Когда бизнес спрашивает «а что нейросети говорят про мой бренд», обычно делают одну вещь: открывают чат, задают вопрос, смотрят ответ. Один раз.
Я решил проверить, сколько правды в таком замере. Взял один промпт и прогнал его по 100 раз через три модели: DeepSeek V3, Gemini 3.5 Flash и GPT-5.2. Триста ответов на один и тот же вопрос, в один день.
Коротко, что получилось:
- у всех трёх моделей одинаковое ядро из трёх брендов, которое не сдвинуть;
- хвост у каждой свой, и три бренда существуют вообще только для одной модели из трёх;
- самая точная по фактам модель оказалась не самой стабильной – точность и повторяемость это разные вещи, которые улучшаются разными способами;
- первое место в списке у каждой модели своё, то есть «быть первым в ответе ИИ» как единой позиции просто не существует.
Методика
Нишу взял нейтральную и проверяемую, чтобы не подгонять выводы под свою категорию: хостинг для интернет-магазина в России.
Промпт (один и тот же, дословно, все 300 раз):
Посоветуй 5 хостинг-провайдеров для интернет-магазина в России. Ответь нумерованным списком, для каждого укажи в одну строку: название – цена самого дешёвого тарифа в рублях в месяц – год основания компании.
Модели:
| Модель | Веб-поиск | Как отвечает |
|---|---|---|
| DeepSeek V3 | нет | из памяти |
| Gemini 3.5 Flash | нет | из памяти, ни одной ссылки за 100 прогонов |
| GPT-5.2 | да | маркеры цитирования в 91 прогоне из 100 |
Температуру не задавал: настройки по умолчанию, как у обычного пользователя API. 30 июля 2026, по 100 запросов на модель, 5 параллельно. Прогон занял от 2 до 4,5 минут на модель и стоил единицы центов.
Про цену и год основания спросил специально. Это проверяемые факты, по которым видно не только «модель назвала разные бренды», но и «модель противоречит сама себе про один и тот же бренд».
1. Ядро одинаковое у всех, хвост у каждого свой
| Бренд | DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 | Что это значит |
|---|---|---|---|---|
| Timeweb | 100% | 100% | 96% | ядро |
| Beget | 100% | 100% | 92% | ядро |
| Reg.ru | 100% | 100% | 92% | ядро |
| Sprinthost | 77% | 91% | 77% | почти ядро |
| SpaceWeb | 44% | 45% | 40% | лотерея, но у всех одинаковая |
| FirstVDS | 39% | 19% | 22% | расходятся вдвое |
| AdminVPS | 0% | 20% | 20% | для DeepSeek не существует |
| Hoster.ru | 0% | 0% | 19% | существует только для GPT-5.2 |
| Nic.ru | 0% | 16% | 0% | существует только для Gemini |
| Hostland | 14% | 0% | 0% | существует только для DeepSeek |
| IHC | 0% | 0% | 13% | существует только для GPT-5.2 |
Три бренда называют практически всегда все три модели. Дальше начинается зона, где присутствие превращается в лотерею, причём разную у разных моделей.
Отдельно стоит посмотреть на нижние четыре строки. AdminVPS, Hoster.ru, Nic.ru и Hostland – это бренды, которые для части моделей не существуют вообще. Не «редко называются», а ноль из ста. Для такого бренда вопрос «видит ли меня ИИ» не имеет одного ответа: у Gemini он в списке каждый шестой раз, у DeepSeek его нет никогда.
Концентрация внимания при этом почти одинаковая:
| DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 | |
|---|---|---|---|
| Доля топ-3 во всех упоминаниях | 60,0% | 60,0% | 56,8% |
| Доля топ-5 | 84,2% | 87,2% | 80,5% |
| Доля «случайных» брендов (названы ≤2 раз) | 2,8% | 0,4% | 3,3% |
| Всего разных брендов за 100 прогонов | 21 | 10 | 22 |
То есть на верхушку у всех уходит примерно 60% упоминаний. Отличается только длина хвоста: Gemini знает десять компаний и всё, у остальных двух – по два десятка, из которых половина всплывает раз или два.
2. Точность и стабильность – это разные вещи
Сначала стабильность состава:
| DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 | |
|---|---|---|---|
| Уникальных наборов из 5 | 24 | 11 | 30 |
| Доля самого частого набора | 28% | 41% | 21% |
| Совпадение двух случайных ответов | 3,9 из 5 | 4,1 из 5 | 3,6 из 5 |
| Один прогон даёт полную картину | 28% | 41% | 29% |
Теперь точность. Год основания сверил с сайтами компаний и открытыми источниками:
| DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 | |
|---|---|---|---|
| Средняя точность года основания | 63% | 100% | 97% |
| У скольких брендов самый частый ответ неверен | 3 из 8 | 0 из 6 | 0 из 6 |
| Прогонов с несуществующим или иностранным брендом | 13% | 0% | 0% |
Складываем и получаем перевёрнутую картину:
- Gemini 3.5 Flash – идеален по фактам (100%) и стабильнее всех (41%), но знает всего 10 компаний. Он просто пересказывает один заученный список.
- GPT-5.2 – почти не врёт (97%), но состав скачет: 30 разных наборов, каждый пятый прогон уникален.
- DeepSeek V3 – худшее из двух миров: и врёт, и скачет.
Логика понятная. Веб-поиск чинит факты, потому что модель их не вспоминает, а подсматривает. Но он же добавляет нестабильности: выдача под каждый запрос чуть разная, и состав ответа едет вслед за ней. А узкая модель без поиска выглядит стабильной просто потому, что ей нечего перебирать.
Для замера видимости отсюда следует важное. Претензия «модель нас не назвала» имеет разный вес в зависимости от того, есть ли у модели поиск. У модели без поиска это приговор: вас нет в её памяти, и чинится это годами присутствия в источниках, на которых её учили. У модели с поиском это сегодняшняя выдача, и чинится обычным контентом за недели.
3. Сколько прогонов нужно, чтобы топ перестал меняться
Считал так: беру первые N прогонов, строю по ним топ-5, сравниваю с эталонным топ-5 по всем ста.
| Прогонов | DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 |
|---|---|---|---|
| 1 | 3 из 5 | 4 из 5 | 5 из 5 |
| 3 | 3 из 5 | 4 из 5 | 4 из 5 |
| 5 | 4 из 5 | 5 из 5 | 4 из 5 |
| 10 | 5 из 5 | 5 из 5 | 5 из 5 |
| 20 | 5 из 5 | 5 из 5 | 5 из 5 |
| 30 | 5 из 5 | 5 из 5 | 5 из 5 |
| 50 | 4 из 5 | 5 из 5 | 5 из 5 |
| 100 | 5 из 5 | 5 из 5 | 5 из 5 |
| Окончательно стабилен с | 71-го прогона | 4-го | 20-го |
Разброс огромный: Gemini успокаивается на четвёртом прогоне, GPT-5.2 на двадцатом, DeepSeek только на семьдесят первом.
И обратите внимание на провал DeepSeek на пятидесятом прогоне. Это не ошибка замера. SpaceWeb (44%) и FirstVDS (39%) идут почти вровень, и порядок между ними переставляется от выборки к выборке – сколько ни добавляй прогонов.
Вывод не «нужно сто прогонов», а более скучный и более полезный: 10-15 прогонов дают устойчивую картину ядра, но не разрешают разницу между близкими соседями. Если два бренда отличаются на 5 процентных пунктов, эта разница внутри погрешности, и гнаться за ней бессмысленно.
4. Первую строку каждая модель отдаёт своему бренду
Кто оказался первым пунктом списка:
| Модель | 1-е место | 2-е по частоте | 3-е |
|---|---|---|---|
| DeepSeek V3 | Reg.ru – 64% | Timeweb 27% | Beget 9% |
| Gemini 3.5 Flash | Beget – 69% | Timeweb 20% | Reg.ru 7% |
| GPT-5.2 | Timeweb – 50% | Beget 27% | Reg.ru 20% |
Три модели, три разных лидера, и все три из одного и того же ядра. Reg.ru, который у DeepSeek первый в двух третях ответов, у Gemini первый лишь в 7%.
Практический смысл: «первое место в ответе ИИ» не существует как единая позиция. Если вы меряете видимость и отчитываетесь про «мы на первом месте», то обязаны говорить, у какой модели, иначе цифра ничего не значит.
5. Цену придумывают все три
Разброс между минимальной и максимальной ценой одного и того же тарифа за 100 прогонов, и в скобках – сколько разных чисел выдала модель:
| Бренд | DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 |
|---|---|---|---|
| Beget | 115–390 ₽ (26) | 220–330 ₽ (5) | 10–520 ₽ (15) |
| Timeweb | 99–450 ₽ (27) | 199–329 ₽ (6) | 169–393 ₽ (9) |
| Reg.ru | 99–549 ₽ (23) | 149–311 ₽ (14) | 75–485 ₽ (11) |
| Sprinthost | 99–490 ₽ (31) | 190–350 ₽ (16) | 98–349 ₽ (15) |
| SpaceWeb | 99–300 ₽ (14) | 159–329 ₽ (11) | 99–299 ₽ (9) |
| FirstVDS | 150–790 ₽ (17) | 279–389 ₽ (7) | 149–300 ₽ (8) |
DeepSeek выдал до 31 разного числа на один тариф. Он цену не помнит, он её каждый раз заново генерирует в правдоподобном диапазоне.
Отдельная оговорка про нижнюю границу GPT-5.2 в 10 ₽ у Beget. Это не галлюцинация: модель нашла в вебе акционную цену и честно её процитировала, а в другом прогоне взяла обычный тариф за 520 ₽. Формально обе цифры настоящие. Но пользователю, который спросил один раз, достаётся одна из них без предупреждения, и разница в 52 раза.
6. Год основания: где именно врёт модель без поиска
| Бренд | Правда | DeepSeek V3 | Gemini 3.5 Flash | GPT-5.2 |
|---|---|---|---|---|
| Beget | 2007 | 98% (2 варианта) | 100% (1) | 100% (1) |
| Timeweb | 2006 | 99% (2) | 100% (1) | 99% (2) |
| Reg.ru | 2006 | 99% (2) | 100% (1) | 100% (1) |
| SpaceWeb | 2001 | 84% (3) | 100% (1) | 100% (1) |
| Sprinthost | 2005 | 5% (12) ✗ | 100% (1) | 100% (1) |
| FirstVDS | 2002 | 0% (9) ✗ | 100% (1) | 81% (3) |
| Hostland | 2003 | 21% (8) ✗ | не называет | не называет |
✗ – самый частый ответ модели не совпадает с правдой.
Про Sprinthost DeepSeek назвал 12 разных годов, разброс с 2000 по 2013, а правильный 2005 прозвучал в 5% случаев. Про FirstVDS правильный год не прозвучал ни разу за 100 прогонов: девять вариантов, все неверные.
Закономерность та же, что и с составом: чем известнее бренд, тем точнее факт. Модель твёрдо знает три компании и плавает во всём остальном. Ровно там, где она плавает, и живёт большинство бизнесов.
Плюс 13 прогонов DeepSeek с прямым мусором в списке «российских хостингов»:
- Hetzner (5 раз), Hostinger (3), A2 Hosting (1) – реальные компании, но не российские. В одном ответе модель сама написала «у A2 Hosting нет серверов в России» и всё равно оставила его в списке. Ещё в трёх прогонах появился несуществующий «Hetzner с локализацией для России».
- Agnihost, CloudHost, Айхост, Хостинг-Телеком – не подтверждаются ни в одном каталоге хостингов. «СloudHost» модель вдобавок написала с кириллической «С» и приписала основание в 2020 году.
У Gemini и GPT-5.2 такого мусора ноль.
7. «Одна модель» – это не одна модель
Прогон DeepSeek шёл через API-роутер, и тот развёл 100 запросов по трём разным инфраструктурным провайдерам: Novita (36 запросов), DeepInfra (32), StreamLake (32). Модель везде называется одинаково.
| Бренд | DeepInfra | Novita | StreamLake |
|---|---|---|---|
| Beget / Reg.ru / Timeweb | 100% | 100% | 100% |
| Sprinthost | 62% | 88% | 71% |
| SpaceWeb | 12% | 77% | 37% |
| FirstVDS | 31% | 25% | 62% |
| Hostland | 40% | 0% | 3% |
SpaceWeb упоминается в 77% ответов у одного провайдера и в 12% у другого. Разница в шесть раз. Hostland у DeepInfra попадает в список в 40% случаев, у Novita не появляется вообще ни разу.
Один и тот же промпт, одна и та же модель, один и тот же день. Отличается только то, на чьём железе и с какой квантизацией модель физически крутится, и на это пользователь никак не влияет и об этом не знает.
Для меня это самый практический вывод из всей затеи. Если вы меряете видимость через API-роутер, часть «волатильности движка» на вашем дашборде – это лотерея роутинга, а не поведение модели.
Насколько модели вообще согласны между собой
Сравнил наборы брендов, которые каждая модель называет хотя бы в 15% прогонов:
| Пара | Общих брендов | Jaccard | Что есть только у одной |
|---|---|---|---|
| DeepSeek ↔ Gemini | 6 из 8 | 0,75 | у Gemini: AdminVPS, Nic.ru |
| DeepSeek ↔ GPT-5.2 | 6 из 8 | 0,75 | у GPT: AdminVPS, Hoster.ru |
| Gemini ↔ GPT-5.2 | 7 из 9 | 0,78 | Nic.ru против Hoster.ru |
Согласие высокое, но неполное, и расходятся модели именно на границе – там, где решается, попадёт бренд в шорт-лист или нет.
Побочная находка: откуда GPT берёт ответ
У GPT-5.2 в ответах видны маркеры источников. В 91 прогоне из 100 он ходил в веб, и в 19 прогонах среди источников был Reddit. Остальное – обычная поисковая выдача: сайты самих хостеров и агрегаторы вроде AdminVPS и Hoster.ru (и это объясняет, почему именно они всплыли в его хвосте).
Это ровно то, о чём говорят все исследования цитируемости: пользовательский контент попадает в ответы ИИ наравне с официальными сайтами. Если про вас на Reddit написано плохо или не написано ничего, это влияет на выдачу так же, как ваша главная страница.
Что со всем этим делать
Если вы бренд. Проверяйте себя минимум на трёх моделях, а не на одной. Ядро (90-100%) означает, что вас знают. Хвост (20-50%) означает, что вас видит примерно половина спрашивающих. Ноль у одной модели при 20% у другой – это не погрешность, это разные картины мира, и лечатся они по-разному: попасть в выдачу для модели с поиском проще, чем попасть в память модели без поиска.
Если вы меряете. Один прогон это не замер, а скриншот случайного момента. Минимальная честная сетка – 10-15 прогонов на промпт, с записью частоты упоминания, а не факта упоминания. Всё, что отличается меньше чем на 10 процентных пунктов, считайте одинаковым. Отчитываясь про позицию, всегда называйте модель. И фиксируйте, какая инфраструктура отвечала.
Если вы пользуетесь нейросетью как справочником. Цифры модели без поиска придумывают заново каждый раз. В нашем замере DeepSeek сгенерировал до 31 разной цены на один тариф и ни разу не назвал правильный год основания одной из компаний.
Ограничения замера
Честно про рамки, потому что иначе выводы будут шире, чем данные.
- Один промпт, одна ниша, один день. Это не «нейросети вообще».
- GPT-5.2 отвечал через API, который подмешивает служебную разметку источников. В 8 прогонах из 100 она съела название пункта, поэтому его метрики состава считались на 92 читаемых прогонах. Точности фактов это не касается.
- Gemini 3.5 Flash показал 100% точность на шести проверенных брендах. Цифра честная для этого набора, но набор узкий: модель просто называет мало компаний.
- Разбор ответов автоматический, по регулярным выражениям, с ручной сводкой вариантов написания ( считались одним брендом).
-
Reg.ru, REG.RU, Реги.ру, SpaceWeb
- Существование редких брендов проверял поиском по каталогам хостингов. Если какой-то из них всё же существует, напишите, поправлю.
Я делаю Ideata – сервис, который следит за тем, что нейросети отвечают про бренды. Этот замер вырос из внутреннего спора: сколько раз надо гонять промпт, чтобы цифре можно было верить. Ответ оказался не тот, которого мы ждали – больше одного раза, но меньше, чем кажется, и совсем не поровну для разных моделей.
Хотите те же цифры по своему бренду – ideata.io/report сделает это бесплатно. Вводите домен, мы собираем реальные вопросы вашей ниши, задаём их ChatGPT, Gemini, Perplexity, Алисе и Google AI Overviews и присылаем разбор: доля видимости по каждому движку, живые цитаты ответов с подсветкой брендов, рейтинг конкурентов и список вопросов, где вас не назвал никто. Две минуты, без карты.
И сразу честно, раз уж статья про это. Бесплатный отчёт – один прогон. По нашим же данным этого хватает, чтобы понять, в ядре вы или в хвосте, но не хватает, чтобы поймать разницу в пять процентных пунктов. Так что читайте его как рентген, а не как термометр: он показывает, есть проблема или нет, а следить за динамикой – это уже регулярные прогоны.
Комментарии