SpaceXAI

Grok 4.6

מודל הקצה הזול של SpaceXAI. משתווה ל-GPT-5.6 Sol במדד האינטליגנציה של Artificial Analysis במחיר נמוך בהרבה - אך חלש יותר במדדי סוכנים ארוכים. טרם נבדק על ידינו.

קלט
$2למיליון טוקנים
פלט
$6למיליון טוקנים
קלט שמור
$0.5למיליון טוקנים
חלון קונטקסט
500K
שוחרר
2026-08

מעל 200,000 טוקנים כל הבקשה עוברת לתעריפי long-context כפולים: $1 קלט שמור, $4 קלט ו-$12 פלט.

בדקנו אותו עלבדיקה שלנו

בנצ'מרקים של DevShift שבהם המודל השתתף.

עדיין לא בדקנו את המודל הזה בבנצ'מרק שלנו.

נתונים מדווחיםלא בדיקה שלנו

מדדים שפורסמו על ידי הספק או מעריך חיצוני. אלה אינם בדיקות שלנו.

מדד מורכב של מעריך עצמאי, המשקלל מגוון משימות לציון יכולת אחד.

CursorBench 3.2

לא בדיקה שלנו

בנצ'מרק בבעלות Cursor, המודד עבודת עריכת קוד בתוך Cursor. אינו עצמאי כשמדובר במודלים ש-Cursor שותפה בפיתוחם.

  • 70.8%דווח על ידי Cursorמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.
  • 69.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיCursor פיתחה את המודל במשותף וגם מחזיקה בבנצ'מרק, ולכן זו עדות מדווחת ולא תוצאה עצמאית.

DeepSWE 1.1

לא בדיקה שלנו

משימות הנדסת תוכנה מבוססות מאגרי קוד אמיתיים.

  • 65.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

Terminal-Bench 3.0

לא בדיקה שלנו

הגרסה המחמירה יותר של Terminal-Bench, שבה כל המודלים עדיין מתקשים.

  • 26%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

FrontierCode

לא בדיקה שלנו

משימות קוד ברמת קושי גבוהה שנכללו בטבלת ההשקה של Grok 4.6.

  • 61.3%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

APEX-Agents

לא בדיקה שלנו

מדד סוכנים שנכלל בטבלת ההשקה של Grok 4.6.

  • 57.5%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

GDPVal-AA v2

לא בדיקה שלנו

מדד המשקלל ערך כלכלי של משימות, לא רק אחוז הצלחה.

  • 1,753דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

SWE-Marathon

לא בדיקה שלנו

משימות הנדסה ארוכות־טווח הבודקות עמידות לאורך זמן.

  • 31.9%דווח על ידי Cursor / SpaceXAIמדווח, לא עצמאיתוצאות המתחרים הן הנתונים העצמיים או הציבוריים הטובים ביותר שצורפו להשקה; רמות המאמץ והמעטפות אינן זהות.

EEBench

לא בדיקה שלנו

מדד הנדסת חשמל מתוך כרטיס המודל של Grok 4.6.

CadGen

לא בדיקה שלנו

מדד יצירת CAD מתוך כרטיס המודל של Grok 4.6.