ספקים

OpenAI

יצרנית משפחת GPT וסביבת Codex. מפרסמת בנצ'מרקים משלה לצד כל השקה.

openai.com

נתונים מדווחים

מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.

מדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.

Terminal-Bench 2.1

לא בדיקה שלנו

משימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.

DeepSWE 1.1

לא בדיקה שלנו

משימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.

מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.

CursorBench 3.2

לא בדיקה שלנו

בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.

  • GPT-5.6 SolMax67.2%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

Terminal-Bench 3.0

לא בדיקה שלנו

הגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.

  • GPT-5.6 SolMax34.6%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

EEBench

לא בדיקה שלנו

מדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.

CadGen

לא בדיקה שלנו

מדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.