ספקים

Anthropic

יצרנית משפחת Claude וסביבת הפיתוח Claude Code. המודלים שלה מככבים ברוב עבודת הפיתוח שלנו בשטח.

www.anthropic.com

נתונים מדווחים

מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.

מדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.

Terminal-Bench 2.1

לא בדיקה שלנו

משימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.

DeepSWE 1.1

לא בדיקה שלנו

משימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.

מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.

CursorBench 3.2

לא בדיקה שלנו

בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.

  • Claude Fable 5Max70.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

Terminal-Bench 3.0

לא בדיקה שלנו

הגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.

  • Claude Fable 5Max34.1%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.