Grok 4.7, Claude Opus 5.5 и DeepSeek V4.1 Flash: какую модель брать в сентябре

Обсудить
Grok 4.7, Claude Opus 5.5 и DeepSeek V4.1 Flash: какую модель брать в сентябре
Реклама. АО «ТаймВэб». erid: 2W5zFH4yb2H

Три крупные лаборатории обновили модели почти в один день, и это редкий случай. DeepSeek выложил открытые веса V4.1 Flash 10 сентября, xAI выпустила Grok 4.7 21-го числа, а Anthropic показала Claude Opus 5.5 днём позже. Ставки у каждого свои: DeepSeek давит ценой, Grok – разумным соотношением цены и скорости, Opus – качеством на длинных задачах.

Я пересмотрел независимые замеры и цифры из отчётов самих компаний и свёл их, чтобы понять, сколько вы заплатите за одну и ту же работу.

Коротко о каждой

Claude Opus 5.5 – старшая модель Anthropic, заточенная под долгие агентные задачи: код, исследования, разбор документов. Контекст – миллион токенов, ответ тянется до 128 тысяч. Рассуждение не отключается, его глубину выставляете уровнем усилия от low до max.

Grok 4.7 собрали на новой, более крупной базовой модели, а не просто дообучили 4.6. Окно – 500 тысяч токенов, рассуждать умеет четырьмя способами, поиск по вебу и по X встроен. В Cursor модель стоит по умолчанию, плюс она работает в Grok Build – собственном агенте xAI для терминала.

DeepSeek V4.1 Flash – открытая модель по лицензии MIT. Всего 552 миллиарда параметров, на каждый токен поднимаются от 8 до 16 миллиардов. Окно – миллион токенов, картинки понимает. Веса выложены на Hugging Face, API перепродают полтора десятка провайдеров.

Тесты расставляют модели по местам

Общая шкала, по которой удобно сверяться, – Intelligence Index от Artificial Analysis. Десять тестов собираются в одно число, и меряют не сами разработчики, а независимые люди.

  • Opus 5.5 – 54 на усилиях high и 58 на max;
  • Grok 4.7 – 46, на два пункта больше прошлой версии;
  • DeepSeek V4.1 Flash – 39. Для открытой модели это солидно: у похожих по размеру открытых моделей медиана – 18.

В агентном программировании разрыв шире. Terminal-Bench 4.0 сажает модель решать задачи в терминале, и Anthropic заявляет для Opus 5.5 66,4%. Grok 4.7 берёт 33% по замеру Artificial Analysis (xAI настаивает на 38%), DeepSeek V4.1 Flash – 31% по данным своей компании. Где задачи проще, как починка багов в DeepSWE, Grok и DeepSeek идут вровень с прошлогодними лидерами – около 73-74%. А на самых трудных экспертных вопросах Humanity's Last Exam у DeepSeek 37% против 56% у прошлого Opus 5.

Строки кода на экране ноутбука. Фото: Artem Sapegin, Unsplash, CC0

Цифры от производителей я бы делил надвое: каждая компания выбирает те выгодные ей тесты и настройки. Но иерархия – Opus, затем Grok, затем DeepSeek – одинакова во всех источниках.

Что это стоит

Цены за миллион токенов, вход и выход:

  • Opus 5.5 – $4 и $20, закэшированный вход – $0,20;
  • Grok 4.7 – $2 и $6, кэш – $0,50;
  • DeepSeek V4.1 Flash – $0,30 и $1,20, кэш – меньше цента.

Оговорки тоже есть. У Grok ставки удваиваются, когда запрос переваливает за 200 тысяч токенов. У DeepSeek всё наоборот: вне пиковых часов цена падает вдвое, а пик – будни с 4 до 7 и с 9 до 13 по Москве. Opus 5.5 подешевел на 20% против Opus 5, и Anthropic обещает ещё около 40% экономии на задаче за счёт меньшего расхода токенов.

Возьму типовой запрос агента: 30 тысяч токенов на входе, 8 тысяч на выходе, кэша нет.

  • Opus 5.5 – около 28 центов;
  • Grok 4.7 – около 11 центов;
  • DeepSeek V4.1 Flash – 2 цента в пик и 1 цент вне пика.

Только цена токена ещё не равна цене задачи. Grok любит поговорить: в агентных тестах Artificial Analysis он выдавал в среднем 81 тысячу выходных токенов на задачу, вдвое больше прошлой версии. DeepSeek тоже не жалеет слов – на прогон индекса ушло 250 миллионов выходных токенов при медиане 140. А на длинном запросе с 250 тысячами токенов на входе Grok из-за двойного тарифа стоит $1,10 – почти как $1,16 у Opus 5.5.

Скорость

Отвечает быстрее всех DeepSeek – около 227 токенов в секунду по замерам Artificial Analysis. Grok 4.7 выдаёт около 188. Opus 5.5 заметно тише, около 92, хотя Anthropic говорит о прибавке в 30% к прошлой версии и продаёт быстрый режим за двойную цену. У Grok такой режим есть, но только в Cursor и Grok Build.

Как это выглядит из России

Claude и Grok из России напрямую не работают. России нет в списке стран Anthropic, а оплатить подписку или API российской картой не выйдет ни там, ни там. Остаются посредники – с наценкой и собственными рисками.

С DeepSeek проще: чат бесплатный и открывается без хитростей, а открытые веса можно поднять на своём сервере. Правда, 552 миллиарда параметров требуют серьёзного железа – это история для компании, а не для домашнего компьютера. Облачная версия имеет и другую сторону: данные хранятся в Китае, а политические темы модель обходит. На коде и рабочих текстах это не сказывается, а вот конфиденциальные документы – повод держать модель у себя.

Суперкомпьютер Columbia в исследовательском центре NASA. Фото: Trower, NASA, общественное достояние

Кому что брать

  • Opus 5.5 – когда задача длинная, а цена ошибки высокая: большой рефакторинг, аудит кода, разбор сотен страниц. Это сильнейшая модель из трёх, и даже после снижения цены типовой запрос на ней в два с половиной раза дороже, чем на Grok.
  • Grok 4.7 – золотая середина: нормальное программирование, быстрые ответы, свежая информация из X. Подходит для автоматизации, где задач много, но каждая несложная. Факты перепроверяйте: в тесте AA-Omniscience модель, не зная ответа, в 29% случаев всё равно отвечает – и неверно.
  • DeepSeek V4.1 Flash – когда важен объём, а не вылизанная каждая задача: черновики, классификация, перевод, массовая обработка текстов. Или когда данные нельзя отдавать в чужое облако.

Что в сухом остатке

Модели, которая хороша везде, нет. Я бы разложил работу так: сложное и ответственное – Opus 5.5, массовое и быстрое с горячими новостями – Grok 4.7, всё, что меряется миллионами токенов, – DeepSeek. Все три вышли за последние две недели, независимые замеры ещё будут уточняться. Прежде чем остановиться на чём-то надолго, прогоните десяток своих задач на каждой: это вечер времени и пара долларов.

Наши постоянные авторы и читатели делятся лайфхаками, основанными на личном опыте. Полная свобода самовыражения.

Комментарии

С помощью соцсетей
У меня нет аккаунта Зарегистрироваться
С помощью соцсетей
У меня уже есть аккаунт Войти
Инструкции по восстановлению пароля высланы на Ваш адрес электронной почты.
Пожалуйста, укажите email вашего аккаунта
Ваш баланс 10 ТК
1 ТК = 1 ₽
О том, как заработать и потратить Таймкарму, читайте в этой статье
Чтобы потратить Таймкарму, зарегистрируйтесь на нашем сайте