ספקים
Anthropic
יצרנית משפחת Claude וסביבת הפיתוח Claude Code. המודלים שלה מככבים ברוב עבודת הפיתוח שלנו בשטח.
נתונים מדווחים
מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.
Artificial Analysis Coding Agent Index
לא בדיקה שלנומדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.
- Claude Fable 577.2דווח על ידי OpenAIמדווח, לא עצמאי
Terminal-Bench 2.1
לא בדיקה שלנומשימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.
- Claude Fable 583.1%דווח על ידי OpenAIמדווח, לא עצמאי
DeepSWE 1.1
לא בדיקה שלנומשימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.
- Claude Fable 569.7%דווח על ידי OpenAIמדווח, לא עצמאי
Artificial Analysis Intelligence Index
לא בדיקה שלנומדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.
- Claude Fable 5Max62דווח על ידי Artificial Analysis
CursorBench 3.2
לא בדיקה שלנובנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.
- Claude Fable 5Max70.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
Terminal-Bench 3.0
לא בדיקה שלנוהגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.
- Claude Fable 5Max34.1%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.