Anthropic

Claude Fable 5

מודל הקוד המוביל של Anthropic. במבחן שלנו הוא הפיק את הארכיטקטורה המודולרית והתוצאה הוויזואלית המרשימה יותר - אבל לקח לו כפול זמן.

קלט
$10למיליון טוקנים
פלט
$50למיליון טוקנים
חלון קונטקסט
1,000K
שוחרר
2026-07

בדקנו אותו עלבדיקה שלנו

בנצ'מרקים של DevShift שבהם המודל השתתף.

23 באוגוסט 2026

בניית אפליקציה מאובטחת רב-ארגונית

Claude Code

זמן ריצה
שעתיים ו-3 דקות
תורי הסוכן
237
סך טוקנים
79.4 מיליון
שורות קוד (ts/tsx)
6,271

הבידוד נאכף בתוך מנוע ה-SQLite: הקוד לעולם לא נוגע בטבלאות בסיס אלא רק ב-views מסוננים לפי ארגון ותפקיד, ו-predicate שנשכח זורק בזמן prepare במקום לדלוף - אימתנו את זה בשבע התקפות עקיפה מול ה-fixture שלו, וכולן נחסמו. הוא כתב 87 בדיקות שאיש לא ביקש, וה-UI מתעדכן אחרי כל שינוי בלי רענון. המחיר: מנגנון צפוף ולא מוכר שמרוכז בשני קבצים קריטיים לתחזוקה.

לבנצ'מרק

20 ביולי 2026

דף נחיתה מפרומפט אחד

Claude Code

זמן ריצה
56 דקות ו-16 שניות
סך טוקנים ב-transcript
19.61 מיליון
טוקני קלט
19.42 מיליון
טוקני פלט
185,220

מנוע תלת-ממד מודולרי יותר, עם הפרדה בין geometry, renderer ו-lifecycle. אחרי תיקוני ה-review לא נשארו ממצאים קריטיים או גבוהים, אבל ה-render loop כבד יותר וקישור ישיר לשלב עלול להשאיר את ה-HUD שלב אחד מאחור עד שממשיכים לגלול.

לבנצ'מרק

מול מי הוא רץ

מודלים שנבדקו מול המודל הזה באותה משימה.

נתונים מדווחיםלא בדיקה שלנו

מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.

מדד ייעודי לסוכני קוד, המודד ביצועים בתוך מעטפת סוכן ולא קריאת מודל בודדת.

  • 77.2דווח על ידי OpenAIמדווח, לא עצמאי

Terminal-Bench 2.1

לא בדיקה שלנו

משימות טרמינל מקצה לקצה הדורשות שימוש נכון בכלים לאורך שלבים מרובים.

  • 83.1%דווח על ידי OpenAIמדווח, לא עצמאי

DeepSWE 1.1

לא בדיקה שלנו

משימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.

  • 69.7%דווח על ידי OpenAIמדווח, לא עצמאי

מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.

CursorBench 3.2

לא בדיקה שלנו

בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.

  • 70.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

Terminal-Bench 3.0

לא בדיקה שלנו

הגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.

  • 34.1%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.