בנצ'מרקים

מה מודלים באמת עושים בעבודה אמיתית

אנחנו נותנים לכמה מודלים את אותה משימה בדיוק, מודדים מה קרה, ומפרסמים את הפרומפט, את הפלט ואת המספרים - כולל כשהתוצאה סותרת את מה שחשבנו.

בדיקה שלנו23 באוגוסט 2026

בניית אפליקציה מאובטחת רב-ארגונית

בריף אחד לאפליקציית דיווח אירועים עם ארבעה תפקידים, בידוד בין ארגונים, קישורי שיתוף זמניים למבטח וגבול הרשאות למבקר - קודם מפרט, אחריו בנייה, ואז תקיפה.

  • Claude Fable 5
  • ox-alpha
לבנצ'מרק

זמן ריצה

  1. Claude Fable 5 + Claude Codeשעתיים ו-3 דקות
  2. ox-alpha + Claude Codeשעה

סך טוקנים

  1. Claude Fable 5 + Claude Code79.4 מיליון
  2. ox-alpha + Claude Code14.2 מיליון

בדיקות שנכתבו

  1. Claude Fable 5 + Claude Code87 עוברות
  2. ox-alpha + Claude Code0

Fable ניצח בבירור על התוצר - בידוד שנכשל-סגור, אבטחה מבנית, בדיקות משלו ומוצר מלוטש שמתעדכן לבד - אבל שילם על זה: פי שניים בזמן, פי חמישה בטוקנים, ו-$107.83 מול $0. ox-alpha בנה אפליקציה תקינה, קריאה וזולה בהרבה, אבל עם בידוד מבוסס-משמעת שהתיעוד שלו עצמו מודה שהוא חלש יותר, בלי בדיקות, וללא ריענון אוטומטי. במשימת אבטחה, ההבדל בין 'נכשל-סגור' ל'דולף בשקט' הוא כל ההבדל.

המודלים שבדקנו

כל מודל, המחיר שלו, מה מדדנו עליו ומה הספקים מדווחים.

מודלי שפה: מחיר, ביצועים ומה מדדנו

בנצ'מרקים שאנחנו עוקבים אחריהם

נתוני ספקים ומעריכים שאנחנו מצטטים במאמרים. שימושיים כהקשר, אבל אף אחד מהם אינו מדידה שלנו.

מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.

מדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.

Terminal-Bench 2.1

לא בדיקה שלנו

משימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.

Terminal-Bench 3.0

לא בדיקה שלנו

הגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.

  • GPT-5.6 SolMax34.6%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
  • Claude Fable 5Max34.1%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
  • Grok 4.6High26%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

DeepSWE 1.1

לא בדיקה שלנו

משימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.

  • GPT-5.6 Sol72.7%דווח על ידי OpenAIמדווח, לא עצמאי
  • Claude Fable 569.7%דווח על ידי OpenAIמדווח, לא עצמאי
  • Grok 4.6High65.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

CursorBench 3.2

לא בדיקה שלנו

בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.

  • Grok 4.6xhigh70.8%דווח על ידי Cursorמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
  • Claude Fable 5Max70.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
  • Grok 4.6High69.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
  • GPT-5.6 SolMax67.2%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

FrontierCode

לא בדיקה שלנו

משימות קוד ברמת קושי גבוהה שנכללו בטבלת ההשקה של Grok 4.6.

  • Grok 4.6High61.3%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

APEX-Agents

לא בדיקה שלנו

מדד סוכנים שנכלל בטבלת ההשקה של Grok 4.6.

  • Grok 4.6High57.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

GDPVal-AA v2

לא בדיקה שלנו

מדד המשקלל ערך כלכלי של משימות, לא רק אחוז הצלחה.

  • Grok 4.6High1,753דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

SWE-Marathon

לא בדיקה שלנו

משימות הנדסה ארוכות־טווח הבודקות עמידות לאורך זמן.

  • Grok 4.6High31.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

EEBench

לא בדיקה שלנו

מדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.

CadGen

לא בדיקה שלנו

מדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.

יש לכם משימה שכדאי שנבדוק?

אם אתם מתלבטים בין מודלים למוצר שאתם בונים, נשמח לשמוע על המקרה שלכם.

בואו נדבר