Три крупные лаборатории обновили модели почти в один день, и это редкий случай. DeepSeek выложил открытые веса V4.1 Flash 10 сентября, xAI выпустила Grok 4.7 21-го числа, а Anthropic показала Claude Opus 5.5 днём позже. Ставки у каждого свои: DeepSeek давит ценой, Grok – разумным соотношением цены и скорости, Opus – качеством на длинных задачах.
Я пересмотрел независимые замеры и цифры из отчётов самих компаний и свёл их, чтобы понять, сколько вы заплатите за одну и ту же работу.
Коротко о каждой
Claude Opus 5.5 – старшая модель Anthropic, заточенная под долгие агентные задачи: код, исследования, разбор документов. Контекст – миллион токенов, ответ тянется до 128 тысяч. Рассуждение не отключается, его глубину выставляете уровнем усилия от low до max.
Grok 4.7 собрали на новой, более крупной базовой модели, а не просто дообучили 4.6. Окно – 500 тысяч токенов, рассуждать умеет четырьмя способами, поиск по вебу и по X встроен. В Cursor модель стоит по умолчанию, плюс она работает в Grok Build – собственном агенте xAI для терминала.
DeepSeek V4.1 Flash – открытая модель по лицензии MIT. Всего 552 миллиарда параметров, на каждый токен поднимаются от 8 до 16 миллиардов. Окно – миллион токенов, картинки понимает. Веса выложены на Hugging Face, API перепродают полтора десятка провайдеров.
Тесты расставляют модели по местам
Общая шкала, по которой удобно сверяться, – Intelligence Index от Artificial Analysis. Десять тестов собираются в одно число, и меряют не сами разработчики, а независимые люди.
- Opus 5.5 – 54 на усилиях high и 58 на max;
- Grok 4.7 – 46, на два пункта больше прошлой версии;
- DeepSeek V4.1 Flash – 39. Для открытой модели это солидно: у похожих по размеру открытых моделей медиана – 18.
В агентном программировании разрыв шире. Terminal-Bench 4.0 сажает модель решать задачи в терминале, и Anthropic заявляет для Opus 5.5 66,4%. Grok 4.7 берёт 33% по замеру Artificial Analysis (xAI настаивает на 38%), DeepSeek V4.1 Flash – 31% по данным своей компании. Где задачи проще, как починка багов в DeepSWE, Grok и DeepSeek идут вровень с прошлогодними лидерами – около 73-74%. А на самых трудных экспертных вопросах Humanity's Last Exam у DeepSeek 37% против 56% у прошлого Opus 5.
![]()
Цифры от производителей я бы делил надвое: каждая компания выбирает те выгодные ей тесты и настройки. Но иерархия – Opus, затем Grok, затем DeepSeek – одинакова во всех источниках.
Что это стоит
Цены за миллион токенов, вход и выход:
- Opus 5.5 – $4 и $20, закэшированный вход – $0,20;
- Grok 4.7 – $2 и $6, кэш – $0,50;
- DeepSeek V4.1 Flash – $0,30 и $1,20, кэш – меньше цента.
Оговорки тоже есть. У Grok ставки удваиваются, когда запрос переваливает за 200 тысяч токенов. У DeepSeek всё наоборот: вне пиковых часов цена падает вдвое, а пик – будни с 4 до 7 и с 9 до 13 по Москве. Opus 5.5 подешевел на 20% против Opus 5, и Anthropic обещает ещё около 40% экономии на задаче за счёт меньшего расхода токенов.
Возьму типовой запрос агента: 30 тысяч токенов на входе, 8 тысяч на выходе, кэша нет.
- Opus 5.5 – около 28 центов;
- Grok 4.7 – около 11 центов;
- DeepSeek V4.1 Flash – 2 цента в пик и 1 цент вне пика.
Только цена токена ещё не равна цене задачи. Grok любит поговорить: в агентных тестах Artificial Analysis он выдавал в среднем 81 тысячу выходных токенов на задачу, вдвое больше прошлой версии. DeepSeek тоже не жалеет слов – на прогон индекса ушло 250 миллионов выходных токенов при медиане 140. А на длинном запросе с 250 тысячами токенов на входе Grok из-за двойного тарифа стоит $1,10 – почти как $1,16 у Opus 5.5.
Скорость
Отвечает быстрее всех DeepSeek – около 227 токенов в секунду по замерам Artificial Analysis. Grok 4.7 выдаёт около 188. Opus 5.5 заметно тише, около 92, хотя Anthropic говорит о прибавке в 30% к прошлой версии и продаёт быстрый режим за двойную цену. У Grok такой режим есть, но только в Cursor и Grok Build.
Как это выглядит из России
Claude и Grok из России напрямую не работают. России нет в списке стран Anthropic, а оплатить подписку или API российской картой не выйдет ни там, ни там. Остаются посредники – с наценкой и собственными рисками.
С DeepSeek проще: чат бесплатный и открывается без хитростей, а открытые веса можно поднять на своём сервере. Правда, 552 миллиарда параметров требуют серьёзного железа – это история для компании, а не для домашнего компьютера. Облачная версия имеет и другую сторону: данные хранятся в Китае, а политические темы модель обходит. На коде и рабочих текстах это не сказывается, а вот конфиденциальные документы – повод держать модель у себя.
![]()
Кому что брать
- Opus 5.5 – когда задача длинная, а цена ошибки высокая: большой рефакторинг, аудит кода, разбор сотен страниц. Это сильнейшая модель из трёх, и даже после снижения цены типовой запрос на ней в два с половиной раза дороже, чем на Grok.
- Grok 4.7 – золотая середина: нормальное программирование, быстрые ответы, свежая информация из X. Подходит для автоматизации, где задач много, но каждая несложная. Факты перепроверяйте: в тесте AA-Omniscience модель, не зная ответа, в 29% случаев всё равно отвечает – и неверно.
- DeepSeek V4.1 Flash – когда важен объём, а не вылизанная каждая задача: черновики, классификация, перевод, массовая обработка текстов. Или когда данные нельзя отдавать в чужое облако.
Что в сухом остатке
Модели, которая хороша везде, нет. Я бы разложил работу так: сложное и ответственное – Opus 5.5, массовое и быстрое с горячими новостями – Grok 4.7, всё, что меряется миллионами токенов, – DeepSeek. Все три вышли за последние две недели, независимые замеры ещё будут уточняться. Прежде чем остановиться на чём-то надолго, прогоните десяток своих задач на каждой: это вечер времени и пара долларов.
Комментарии