- Grok 4.7 отримала більшу базову модель і посилений механізм перевірки власної роботи.
- На CursorBench 4.0 модель набрала 46,3%, обійшовши GPT-5.6 Sol, але поступившись Fable 5.1.
- Незалежні тести підтвердили прогрес в агентних завданнях, хоча результати помітно залежать від середовища запуску та типу навантаження.
Компанія SpaceXAI представила модель Grok 4.7, орієнтовану на програмування, роботу зі знаннями та складні завдання, виконання яких може тривати кілька годин. Вона побудована на більшій базовій моделі, ніж Grok 4.6, і пройшла триваліший етап навчання з підкріпленням.
Розробники заявили, що Grok 4.7 краще керує довгим контекстом, ретельніше перевіряє результати та адаптована для роботи всередині Grok Build. Модель доступна в Cursor, Grok Build, через API та низку сторонніх платформ.
Вартість становить $2 за 1 млн вхідних і $6 за 1 млн вихідних токенів. Версія Fast працює вдвічі швидше й коштує вдвічі дорожче.
Можливості та порівняння з іншими моделями
В опублікованих SpaceXAI тестах Grok 4.7 помітно поліпшила результати попередньої версії. На CursorBench 4.0 модель отримала 46,3% проти 40,4% у Grok 4.6. Для порівняння, GPT-5.6 Sol набрав 41,7%, а Fable 5.1 — 51,8%. На DeepSWE v1.1 результати становили 71%, 72,7% і 70% відповідно.
На завданнях із терміналом Grok 4.7 показала 38% проти 20,3% у попередньої версії та 37,3% у GPT-5.6 Sol. Fable 5.1 при цьому помітно випередила конкурентів із результатом 57,9%. У тесті EEBench для електротехнічних завдань Grok отримала 64%, перевищивши показники обох суперників із таблиці SpaceXAI. На HealthBench Professional вона, навпаки, поступилася їм.
Однією з переваг залишається вартість. Зазначені SpaceXAI тарифи для GPT-5.6 Sol становлять $4 і $20 за 1 млн вхідних і вихідних токенів відповідно, для Fable 5.1 — $10 і $50. Таким чином, нижча ціна Grok не означає лідерства за всіма тестами, однак посилює її позиції в сценаріях із великим обсягом обчислень.

Claude Fable 5.1: що вміє найпотужніша модель Anthropic і як за її допомогою створити 3D-модель авіадвигуна 03.09.2026 Читати
OpenAI випустила GPT-6 Astra: огляд нової флагманської моделі 05.09.2026 Читати
Окрему увагу розробники приділили кібербезпеці. У SpaceXAI заявили про повністю оновлену систему захисних механізмів.
У власному HackerBench v0.3 модель пропустила 3,3% запитів, які компанія відносить до небезпечних сценаріїв подвійного призначення. Водночас розробники стверджують, що система намагається не блокувати легітимну роботу фахівців із безпеки.
Деякі партнери отримали доступ до можливостей Grok 4.7 для закритого red teaming. Ці результати опубліковані самою SpaceXAI і поки що не є незалежною оцінкою.
Що кажуть експерти
Незалежна платформа Artificial Analysis повідомила в X, що Grok 4.7 отримала 46 балів у її Intelligence Index — на два пункти більше, ніж Grok 4.6. Особливо помітний прогрес аналітики виявили у тривалих агентних завданнях. У їхньому Coding Agent Index зв’язка Grok 4.7 і Grok Build набрала 56 балів проти 47 у попередньої версії.
Водночас фахівці звернули увагу на витрати ресурсів. У режимі xhigh Grok 4.7 використовувала близько 81 000 вихідних токенів на одне завдання Intelligence Index — більш ніж удвічі більше, ніж попередня версія у зіставному режимі. В Artificial Analysis вважають, що основні поліпшення зосереджені саме в агентній роботі, тоді як у частині інших тестів зміни виявилися незначними.
Інша бенчмарк-платформа Vals AI отримала менш однозначні результати. У її наборі тестів Grok 4.7 набрала 54,2% і посіла 24-те місце проти 59,2% і 14-ї позиції у Grok 4.6. Найпомітніші поліпшення фахівці побачили в юридичних і медичних завданнях. Різниця з результатами Artificial Analysis показує, наскільки оцінка моделі залежить від методології та конкретного набору сценаріїв.
Компанія XBOW, що спеціалізується на ШІ для кібербезпеки, також отримала ранній доступ до Grok 4.7 і перевірила її на завданнях offensive security. Підсумки виявилися змішаними. У стандартному середовищі модель у низці тестів трохи поступалася Grok 4.6 і іноді вимагала більше ітерацій для досягнення результату.
Картина змінилася при використанні Grok Build. В одному з наборів тестів системи на базі цього середовища збільшили кількість коректно знайдених проблем із 42 для Grok 4.6 до 68 для Grok 4.7.
У XBOW дійшли висновку, що важливою особливістю нової версії стала не стільки здатність розв’язувати принципово нові класи завдань, скільки ефективніша робота всередині відповідної агентної інфраструктури. Водночас за якістю в offensive security фахівці поки що ставлять її нижче за найсильніші протестовані ними системи.
Загалом перші незалежні оцінки вказують на помітний прогрес Grok у тривалих агентних сценаріях і програмуванні. Водночас тести показують, що переваги версії 4.7 не є універсальними й можуть залежати від обраного інструментарію, рівня міркувань і конкретного навантаження.
Сообщение SpaceXAI представила Grok 4.7 з акцентом на кодування та багатогодинні завдання появились сначала на INCRYPTED.








