OpenAI

GPT-5.6 Sol

מודל הקוד המוביל של OpenAI. במבחן שלנו סיים בכחצי מהזמן עם כ-26% פחות טוקנים, במימוש קומפקטי וחסכוני יותר בזמן ריצה.

קלט
$5למיליון טוקנים
פלט
$30למיליון טוקנים
חלון קונטקסט
1,050K
שוחרר
2026-07

המודל תומך ב-1.05 מיליון טוקנים, אך קטלוג Codex שבו השתמשנו חשף חלון של 272,000 טוקנים בלבד.

בדקנו אותו עלבדיקה שלנו

בנצ'מרקים של DevShift שבהם המודל השתתף.

20 ביולי 2026

דף נחיתה מפרומפט אחד

Codex

זמן ריצה
28 דקות ו-44 שניות
סך טוקנים ב-transcript
14.54 מיליון
טוקני קלט
14.48 מיליון
טוקני פלט
57,498

מימוש קטן וחסכוני יותר בזמן ריצה: bounds נשמרים, DPR מוגבל וה-rendering נעצר כשאין תנועה. המחיר הוא renderer ו-lifecycle מרוכזים ב-client component אחד של 766 שורות.

לבנצ'מרק

מול מי הוא רץ

מודלים שנבדקו מול המודל הזה באותה משימה.

נתונים מדווחיםלא בדיקה שלנו

מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.

מדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.

  • 80דווח על ידי OpenAIמדווח, לא עצמאי

Terminal-Bench 2.1

לא בדיקה שלנו

משימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.

  • 88.8%דווח על ידי OpenAIמדווח, לא עצמאי

DeepSWE 1.1

לא בדיקה שלנו

משימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.

  • 72.7%דווח על ידי OpenAIמדווח, לא עצמאי

מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.

CursorBench 3.2

לא בדיקה שלנו

בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.

  • 67.2%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

Terminal-Bench 3.0

לא בדיקה שלנו

הגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.

  • 34.6%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

EEBench

לא בדיקה שלנו

מדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.

CadGen

לא בדיקה שלנו

מדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.