נתונים מדווחים
מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.
Artificial Analysis Coding Agent Index
לא בדיקה שלנומדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.
- GPT-5.6 Sol80דווח על ידי OpenAIמדווח, לא עצמאי
Terminal-Bench 2.1
לא בדיקה שלנומשימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.
- GPT-5.6 Sol88.8%דווח על ידי OpenAIמדווח, לא עצמאי
DeepSWE 1.1
לא בדיקה שלנומשימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.
- GPT-5.6 Sol72.7%דווח על ידי OpenAIמדווח, לא עצמאי
Artificial Analysis Intelligence Index
לא בדיקה שלנומדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.
- GPT-5.6 SolMax61דווח על ידי Artificial Analysis
CursorBench 3.2
לא בדיקה שלנובנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.
- GPT-5.6 SolMax67.2%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
Terminal-Bench 3.0
לא בדיקה שלנוהגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.
- GPT-5.6 SolMax34.6%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
EEBench
לא בדיקה שלנומדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.
- GPT-5.6 Sol39.4דווח על ידי SpaceXAI model cardמדווח, לא עצמאי
CadGen
לא בדיקה שלנומדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.
- GPT-5.6 Sol37.1דווח על ידי SpaceXAI model cardמדווח, לא עצמאי