Grok 4.6
מודל הקצה הזול של SpaceXAI. משתווה ל-GPT-5.6 Sol במדד האינטליגנציה של Artificial Analysis במחיר נמוך בהרבה - אך חלש יותר במדדי סוכנים ארוכים. טרם נבדק על ידינו.
- קלט
- $2למיליון טוקנים
- פלט
- $6למיליון טוקנים
- קלט שמור
- $0.5למיליון טוקנים
- חלון קונטקסט
- 500K
- שוחרר
- 2026-08
מעל 200,000 טוקנים כל הבקשה עוברת לתעריפי long-context כפולים: $1 קלט שמור, $4 קלט ו-$12 פלט.
בדקנו אותו עלבדיקה שלנו
בנצ'מרקים של DevShift שבהם המודל השתתף.
עדיין לא בדקנו את המודל הזה בבנצ'מרק שלנו.
נתונים מדווחיםלא בדיקה שלנו
מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.
Artificial Analysis Intelligence Index
לא בדיקה שלנומדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.
- 61דווח על ידי Artificial Analysis
CursorBench 3.2
לא בדיקה שלנובנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.
- 70.8%דווח על ידי Cursorמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
- 69.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
DeepSWE 1.1
לא בדיקה שלנומשימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.
- 65.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
Terminal-Bench 3.0
לא בדיקה שלנוהגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.
- 26%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
FrontierCode
לא בדיקה שלנומשימות קוד ברמת קושי גבוהה שנכללו בטבלת ההשקה של Grok 4.6.
- 61.3%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
APEX-Agents
לא בדיקה שלנומדד סוכנים שנכלל בטבלת ההשקה של Grok 4.6.
- 57.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
GDPVal-AA v2
לא בדיקה שלנומדד המשקלל ערך כלכלי של משימות, לא רק אחוז הצלחה.
- 1,753דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
SWE-Marathon
לא בדיקה שלנומשימות הנדסה ארוכות־טווח הבודקות עמידות לאורך זמן.
- 31.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.
EEBench
לא בדיקה שלנומדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.
- 60דווח על ידי SpaceXAI model cardמדווח, לא עצמאי
CadGen
לא בדיקה שלנומדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.
- 40.9דווח על ידי SpaceXAI model cardמדווח, לא עצמאי
מוזכר במאמרים
- Grok 4.6 שובר את מחיר מודלי הקצה — ו-Cursor כבר בפנים · אוגוסט 2026