Блог/Grok 4.6 вышел: разбираем тесты и цену долгих задач
Новости

Grok 4.6 вышел: разбираем тесты и цену долгих задач

Проверяем, где Grok 4.6 действительно прибавила, почему стоимость одного задания полезнее цены миллиона токенов и кому уже стоит запускать собственный пилот.

Данил Макаров
Данил Макаров·маркетолог
13 августа 2026 г.·8 мин чтения

Короткий ответ: 12 августа 2026 года SpaceXAI выпустила Grok 4.6 с контекстом на 500 тысяч токенов и четырьмя уровнями рассуждения. В CursorBench 3.2 конфигурация Extra High получила 70,8% при средней стоимости 2,81 доллара за задание. Для длинных процессов важен порог в 200 тысяч токенов: после него ставки API удваиваются.

Grok 4.6 получила явный уклон в длинную агентную работу. В первых тестах она держится рядом с сильнейшими конкурентами, а в CursorBench выходит вперёд при средней стоимости 2,81 доллара за задание.

Цифра выглядит приятно. Почти так же приятно, как счёт из ресторана, пока никто не вспомнил про вино. У Grok 4.6 таким вином стал длинный контекст: после 200 тысяч токенов тариф удваивается. Поэтому разберёмся, где модель действительно прибавила, сколько стоит длинный прогон и кому есть смысл пробовать её прямо сейчас.

Официальный визуал Grok 4.6
Официальный визуал Grok 4.6

Официальный визуал релиза Grok 4.6. Источник: SpaceXAI.

Что именно выпустили

Grok 4.6 продолжает линию Grok 4.5 и рассчитана на задачи, в которых агент долго живёт внутри одного проекта. Он читает кодовую базу, ищет информацию, вызывает инструменты, исправляет ошибки и продолжает работу после нескольких неудачных попыток. Разработчик отдельно выделяет программирование, аналитическую работу, веб-разработку, проектирование интерфейсов и САПР.

Модель принимает текст и изображения, возвращает текст и работает с контекстом до 500 тысяч токенов. Доступны четыре уровня рассуждения: низкий, средний, высокий и сверхвысокий. Высокий включён по умолчанию. Через API можно подключать функции, веб-поиск, поиск по X и выполнение кода. Дата отсечения знаний приходится на 1 февраля 2026 года. Свежие события без поисковых инструментов модель не узнает.

На старте Grok 4.6 появилась в Grok Build, Cursor и API SpaceXAI, а также у OpenRouter, Vercel и Cloudflare. Первую неделю Cursor и Grok Build дают двойной включённый объём использования.

SpaceXAI сообщает о более длинном дополнительном обучении по сравнению с Grok 4.5. В данных были инженерные задачи, технические рассуждения и траектории агентов в разных средах. Затем модель дообучали с подкреплением на программировании, работе со знаниями, оптимизации ядер, веб-разработке и проектировании. Компания также отмечает, что на длинных прогонах модель чаще проверяет собственную работу. Независимой проверки этого наблюдения пока нет.

В тестах виден большой шаг относительно Grok 4.5

Самое уверенное утверждение по итогам первого дня звучит скромно: Grok 4.6 заметно сильнее предыдущей версии. Сводный индекс Artificial Analysis в таблице SpaceXAI вырос с 56 до 61. На DeepSWE результат поднялся с 54% до 65,9%, на Terminal-Bench с 15,7% до 26%, на APEX-Agents с 47,1% до 57,5%.

С конкурентами картина неровная. В сводном индексе Grok 4.6 делит 61 балл с GPT-5.6 Sol и на один балл отстаёт от Fable 5. В GDPVal-AA модель набрала 1753 пункта и заняла первое место в таблице SpaceXAI. В тесте юридической работы Harvey LAB она тоже лидирует с 15,8%.

Есть и холодная вода. В DeepSWE у Grok 65,9% против 73% у GPT-5.6 Sol и 70% у Fable 5. В Terminal-Bench разрыв ещё заметнее: 26% против 34,6% и 34,1%. Fable 5 также выше в FrontierCode, APEX-Agents и APEX-SWE.

Получился сильный универсальный агент со своими удобными территориями. По стартовым цифрам Grok 4.6 особенно интересна для работы со знаниями, широких задач в кодовой базе и длительных процессов. Терминальные сценарии и часть сложных программных тестов пока остаются слабее лидеров.

Самая интересная таблица находится у Cursor

CursorBench 3.2 собирает неоднозначные многофайловые задачи из реальных сессий Cursor. Агенту приходится понимать кодовую базу, следовать инструкциям и пользоваться инструментами. В режиме Extra High Grok 4.6 получила 70,8%, потратила в среднем 41 136 токенов, сделала 46 шагов и обошлась в 2,81 доллара на задание.

Для сравнения, Fable 5 Max набрала 70,5% при стоимости 17,32 доллара и 72 шагах. Opus 5 Max получила 70% при 8,23 доллара и 78 шагах. GPT-5.6 Sol Max показала 67,2% при 5,69 доллара и 48 шагах.

Результат и средняя стоимость задания в CursorBench 3.2
Результат и средняя стоимость задания в CursorBench 3.2

CursorBench 3.2: результат по вертикали, средняя стоимость задания по горизонтали. Источник: Cursor.

Разница между 70,8% и 70,5% слишком мала для торжественного барабана. Сам Cursor предупреждает, что близкие результаты могут оказаться статистически незначимыми. Стоимость и число шагов дают больше пищи для практики: Grok прошла тест короче и дешевле нескольких моделей с почти тем же результатом.

У теста есть важное ограничение. Cursor участвовал в запуске модели, а в её обучении использовались траектории из разных агентных сред. Результат CursorBench описывает связку модели с системным промптом, инструментами, управлением контекстом, повторными попытками и проверками. Именно такую связку покупает пользователь агентного редактора, хотя переносить её результат в другую среду автоматически нельзя.

Цена токена начинает обманывать глаз

На коротких запросах базовая цена Grok 4.6 совпадает с Grok 4.5: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных. Кэшированный вход стоит 50 центов. Быстрая версия модели обходится вдвое дороже.

После 200 тысяч токенов в промпте ставки удваиваются:

  • входные токены: 4 доллара за миллион;
  • кэшированный вход: 1 доллар за миллион;
  • выходные токены: 12 долларов за миллион.

Возьмём упрощённый пример без кэша и платных инструментов. Запрос со 150 тысячами входных и 20 тысячами выходных токенов стоит около 42 центов. Длинный прогон с 300 тысячами входных и 40 тысячами выходных обойдётся примерно в 1,68 доллара. При базовом тарифе тот же объём стоил бы 84 цента.

Агент редко ограничивается одним запросом. Он возвращается к файлам, тащит историю решений, запускает тесты, получает ошибку и идёт на новый круг. Контекст растёт, а вместе с ним растёт счёт. Удачная модель может компенсировать дорогие токены меньшим числом кругов. Нервная модель способна сжечь дешёвый тариф серией бодрых прогулок по неверной ветке.

Поэтому для агентных систем полезно считать четыре показателя: долю завершённых задач, среднюю стоимость прогона, число вмешательств человека и время до принятого результата. Цена миллиона токенов остаётся частью расчёта. Итог обычно определяется тем, сколько раз агент перечитал проект и сколько работы пришлось переделать после него.

Как проверить Grok 4.6 на своей работе

Один вечер с любимым промптом почти ничего не покажет. Для нормальной проверки достаточно взять десять типичных задач, которые уже решались другой моделью. Подойдут исправление бага, рефакторинг нескольких файлов, подготовка отчёта с поиском, сборка небольшого интерфейса и разбор незнакомого репозитория.

Для каждого прогона стоит записать:

  • выполнена ли задача полностью;
  • сколько времени прошло до готового результата;
  • сколько токенов и денег потрачено;
  • сколько раз человек возвращал агента на маршрут;
  • прошли ли тесты и ручная проверка;
  • какой объём контекста накопился к концу.

Среднего режима рассуждения хватит для первой серии. Затем самые сложные задачи можно повторить на высоком и сверхвысоком уровнях. Такой порядок покажет, где дополнительное рассуждение действительно окупается. Заодно станет видно, как часто процесс пересекает порог 200 тысяч токенов.

Для длинных циклов документация SpaceXAI рекомендует кэширование промпта и сжатие контекста. Эти настройки напрямую влияют на счёт и задержку: полезны стабильная системная инструкция, повторно используемые файлы и своевременное сжатие истории.

Кому уже стоит пробовать

Grok 4.6 выглядит разумным кандидатом для команд, которые уже используют Cursor или собирают собственных агентов через API. Особенно хорошо совпадают задачи с большим репозиторием, несколькими инструментами и длинной цепочкой проверок. Пользователям Grok 4.5 переход тоже имеет смысл протестировать: прирост относительно предыдущей версии виден почти во всех опубликованных тестах.

В простых чатах длинная траектория встречается редко. Выбор модели там чаще упирается в качество конкретных текстов, скорость и привычный интерфейс, поэтому спешка не требуется. Осторожность нужна и терминальным агентам. На Terminal-Bench новая версия прибавила много, но пока заметно уступает GPT-5.6 Sol и Fable 5.

Первые сутки дают достаточно данных для хорошего пилота и слишком мало для коронации. Grok 4.6 уже выглядит одним из самых экономичных сильных агентов внутри Cursor. Следующий вопрос придётся решать на собственных задачах: сколько стоит принятый результат после всех шагов, откатов и человеческих проверок. Именно там заканчивается таблица и начинается работа.

Частые вопросы

Когда вышла Grok 4.6?

SpaceXAI выпустила модель 12 августа 2026 года. На старте она доступна через API, Grok Build, Cursor и нескольких облачных партнёров.

Какой контекст поддерживает Grok 4.6?

Контекстное окно составляет 500 тысяч токенов. После 200 тысяч токенов в промпте ставки API удваиваются, поэтому длинные агентные процессы стоит проектировать с кэшированием и сжатием истории.

Сколько стоит API Grok 4.6?

До порога 200 тысяч токенов цена составляет 2 доллара за миллион входных, 50 центов за миллион кэшированных входных и 6 долларов за миллион выходных токенов. Выше порога ставки составляют 4, 1 и 12 долларов соответственно.

Grok 4.6 сильнее GPT-5.6 Sol и Fable 5?

Ответ зависит от задачи. Grok лидирует в некоторых тестах знаний и показывает сильную экономику в CursorBench. В DeepSWE и Terminal-Bench конкуренты пока выше.

Как сравнивать модели для ИИ-агента?

Кроме цены токенов, фиксируйте долю полностью выполненных задач, среднюю стоимость прогона, время до результата и число вмешательств человека. Для агентной системы эти показатели обычно полезнее одного места в рейтинге.

Источники

Создать сайт с ИИ в Lork

Поделиться:Сообщество Lork в Telegram
Данил Макаров

Автор

Данил Макаров, маркетолог

Данил Макаров занимается маркетингом Lork и разбирает AI-инструменты, SEO и запуск сайтов с точки зрения привлечения заявок.

Готовы попробовать?

Запустите страницу для заявок с помощью ИИ

Опишите бизнес или услугу текстом — Lork соберет оффер, дизайн, структуру и форму заявки.

Запустить бесплатно →