מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.
מדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.
Terminal-Bench 2.1
לא בדיקה שלנומשימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.
Terminal-Bench 3.0
לא בדיקה שלנוהגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.
- GPT-5.6 SolMax34.6%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
- Claude Fable 5Max34.1%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
- Grok 4.6High26%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
DeepSWE 1.1
לא בדיקה שלנומשימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.
בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.
- Grok 4.6xhigh70.8%דווח על ידי Cursorמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
- Claude Fable 5Max70.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
- Grok 4.6High69.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
- GPT-5.6 SolMax67.2%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
FrontierCode
לא בדיקה שלנומשימות קוד ברמת קושי גבוהה שנכללו בטבלת ההשקה של Grok 4.6.
- Grok 4.6High61.3%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
APEX-Agents
לא בדיקה שלנומדד סוכנים שנכלל בטבלת ההשקה של Grok 4.6.
- Grok 4.6High57.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
GDPVal-AA v2
לא בדיקה שלנומדד המשקלל ערך כלכלי של משימות, לא רק אחוז הצלחה.
- Grok 4.6High1,753דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
SWE-Marathon
לא בדיקה שלנומשימות הנדסה ארוכות־טווח הבודקות עמידות לאורך זמן.
- Grok 4.6High31.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
EEBench
לא בדיקה שלנומדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.
CadGen
לא בדיקה שלנומדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.