Задал нейросетям один вопрос 300 раз и получил 65 разных ответов

Обсудить
Задал нейросети один вопрос 300 раз и получил 65 разных ответов
Реклама. АО «ТаймВэб». erid: 2W5zFJGYac9

Когда бизнес спрашивает «а что нейросети говорят про мой бренд», обычно делают одну вещь: открывают чат, задают вопрос, смотрят ответ. Один раз.

Я решил проверить, сколько правды в таком замере. Взял один промпт и прогнал его по 100 раз через три модели: DeepSeek V3, Gemini 3.5 Flash и GPT-5.2. Триста ответов на один и тот же вопрос, в один день.

Коротко, что получилось:

  • у всех трёх моделей одинаковое ядро из трёх брендов, которое не сдвинуть;
  • хвост у каждой свой, и три бренда существуют вообще только для одной модели из трёх;
  • самая точная по фактам модель оказалась не самой стабильной – точность и повторяемость это разные вещи, которые улучшаются разными способами;
  • первое место в списке у каждой модели своё, то есть «быть первым в ответе ИИ» как единой позиции просто не существует.

Методика

Нишу взял нейтральную и проверяемую, чтобы не подгонять выводы под свою категорию: хостинг для интернет-магазина в России.

Промпт (один и тот же, дословно, все 300 раз):

Посоветуй 5 хостинг-провайдеров для интернет-магазина в России. Ответь нумерованным списком, для каждого укажи в одну строку: название – цена самого дешёвого тарифа в рублях в месяц – год основания компании.

Модели:

Модель Веб-поиск Как отвечает
DeepSeek V3 нет из памяти
Gemini 3.5 Flash нет из памяти, ни одной ссылки за 100 прогонов
GPT-5.2 да маркеры цитирования в 91 прогоне из 100

Температуру не задавал: настройки по умолчанию, как у обычного пользователя API. 30 июля 2026, по 100 запросов на модель, 5 параллельно. Прогон занял от 2 до 4,5 минут на модель и стоил единицы центов.

Про цену и год основания спросил специально. Это проверяемые факты, по которым видно не только «модель назвала разные бренды», но и «модель противоречит сама себе про один и тот же бренд».

1. Ядро одинаковое у всех, хвост у каждого свой

Бренд DeepSeek V3 Gemini 3.5 Flash GPT-5.2 Что это значит
Timeweb 100% 100% 96% ядро
Beget 100% 100% 92% ядро
Reg.ru 100% 100% 92% ядро
Sprinthost 77% 91% 77% почти ядро
SpaceWeb 44% 45% 40% лотерея, но у всех одинаковая
FirstVDS 39% 19% 22% расходятся вдвое
AdminVPS 0% 20% 20% для DeepSeek не существует
Hoster.ru 0% 0% 19% существует только для GPT-5.2
Nic.ru 0% 16% 0% существует только для Gemini
Hostland 14% 0% 0% существует только для DeepSeek
IHC 0% 0% 13% существует только для GPT-5.2

Три бренда называют практически всегда все три модели. Дальше начинается зона, где присутствие превращается в лотерею, причём разную у разных моделей.

Отдельно стоит посмотреть на нижние четыре строки. AdminVPS, Hoster.ru, Nic.ru и Hostland – это бренды, которые для части моделей не существуют вообще. Не «редко называются», а ноль из ста. Для такого бренда вопрос «видит ли меня ИИ» не имеет одного ответа: у Gemini он в списке каждый шестой раз, у DeepSeek его нет никогда.

Концентрация внимания при этом почти одинаковая:

  DeepSeek V3 Gemini 3.5 Flash GPT-5.2
Доля топ-3 во всех упоминаниях 60,0% 60,0% 56,8%
Доля топ-5 84,2% 87,2% 80,5%
Доля «случайных» брендов (названы ≤2 раз) 2,8% 0,4% 3,3%
Всего разных брендов за 100 прогонов 21 10 22

То есть на верхушку у всех уходит примерно 60% упоминаний. Отличается только длина хвоста: Gemini знает десять компаний и всё, у остальных двух – по два десятка, из которых половина всплывает раз или два.

2. Точность и стабильность – это разные вещи

Сначала стабильность состава:

  DeepSeek V3 Gemini 3.5 Flash GPT-5.2
Уникальных наборов из 5 24 11 30
Доля самого частого набора 28% 41% 21%
Совпадение двух случайных ответов 3,9 из 5 4,1 из 5 3,6 из 5
Один прогон даёт полную картину 28% 41% 29%

Теперь точность. Год основания сверил с сайтами компаний и открытыми источниками:

  DeepSeek V3 Gemini 3.5 Flash GPT-5.2
Средняя точность года основания 63% 100% 97%
У скольких брендов самый частый ответ неверен 3 из 8 0 из 6 0 из 6
Прогонов с несуществующим или иностранным брендом 13% 0% 0%

Складываем и получаем перевёрнутую картину:

  • Gemini 3.5 Flash – идеален по фактам (100%) и стабильнее всех (41%), но знает всего 10 компаний. Он просто пересказывает один заученный список.
  • GPT-5.2 – почти не врёт (97%), но состав скачет: 30 разных наборов, каждый пятый прогон уникален.
  • DeepSeek V3 – худшее из двух миров: и врёт, и скачет.

Логика понятная. Веб-поиск чинит факты, потому что модель их не вспоминает, а подсматривает. Но он же добавляет нестабильности: выдача под каждый запрос чуть разная, и состав ответа едет вслед за ней. А узкая модель без поиска выглядит стабильной просто потому, что ей нечего перебирать.

Для замера видимости отсюда следует важное. Претензия «модель нас не назвала» имеет разный вес в зависимости от того, есть ли у модели поиск. У модели без поиска это приговор: вас нет в её памяти, и чинится это годами присутствия в источниках, на которых её учили. У модели с поиском это сегодняшняя выдача, и чинится обычным контентом за недели.

3. Сколько прогонов нужно, чтобы топ перестал меняться

Считал так: беру первые N прогонов, строю по ним топ-5, сравниваю с эталонным топ-5 по всем ста.

Прогонов DeepSeek V3 Gemini 3.5 Flash GPT-5.2
1 3 из 5 4 из 5 5 из 5
3 3 из 5 4 из 5 4 из 5
5 4 из 5 5 из 5 4 из 5
10 5 из 5 5 из 5 5 из 5
20 5 из 5 5 из 5 5 из 5
30 5 из 5 5 из 5 5 из 5
50 4 из 5 5 из 5 5 из 5
100 5 из 5 5 из 5 5 из 5
Окончательно стабилен с 71-го прогона 4-го 20-го

Разброс огромный: Gemini успокаивается на четвёртом прогоне, GPT-5.2 на двадцатом, DeepSeek только на семьдесят первом.

И обратите внимание на провал DeepSeek на пятидесятом прогоне. Это не ошибка замера. SpaceWeb (44%) и FirstVDS (39%) идут почти вровень, и порядок между ними переставляется от выборки к выборке – сколько ни добавляй прогонов.

Вывод не «нужно сто прогонов», а более скучный и более полезный: 10-15 прогонов дают устойчивую картину ядра, но не разрешают разницу между близкими соседями. Если два бренда отличаются на 5 процентных пунктов, эта разница внутри погрешности, и гнаться за ней бессмысленно.

4. Первую строку каждая модель отдаёт своему бренду

Кто оказался первым пунктом списка:

Модель 1-е место 2-е по частоте 3-е
DeepSeek V3 Reg.ru – 64% Timeweb 27% Beget 9%
Gemini 3.5 Flash Beget – 69% Timeweb 20% Reg.ru 7%
GPT-5.2 Timeweb – 50% Beget 27% Reg.ru 20%

Три модели, три разных лидера, и все три из одного и того же ядра. Reg.ru, который у DeepSeek первый в двух третях ответов, у Gemini первый лишь в 7%.

Практический смысл: «первое место в ответе ИИ» не существует как единая позиция. Если вы меряете видимость и отчитываетесь про «мы на первом месте», то обязаны говорить, у какой модели, иначе цифра ничего не значит.

5. Цену придумывают все три

Разброс между минимальной и максимальной ценой одного и того же тарифа за 100 прогонов, и в скобках – сколько разных чисел выдала модель:

Бренд DeepSeek V3 Gemini 3.5 Flash GPT-5.2
Beget 115–390 ₽ (26) 220–330 ₽ (5) 10–520 ₽ (15)
Timeweb 99–450 ₽ (27) 199–329 ₽ (6) 169–393 ₽ (9)
Reg.ru 99–549 ₽ (23) 149–311 ₽ (14) 75–485 ₽ (11)
Sprinthost 99–490 ₽ (31) 190–350 ₽ (16) 98–349 ₽ (15)
SpaceWeb 99–300 ₽ (14) 159–329 ₽ (11) 99–299 ₽ (9)
FirstVDS 150–790 ₽ (17) 279–389 ₽ (7) 149–300 ₽ (8)

DeepSeek выдал до 31 разного числа на один тариф. Он цену не помнит, он её каждый раз заново генерирует в правдоподобном диапазоне.

Отдельная оговорка про нижнюю границу GPT-5.2 в 10 ₽ у Beget. Это не галлюцинация: модель нашла в вебе акционную цену и честно её процитировала, а в другом прогоне взяла обычный тариф за 520 ₽. Формально обе цифры настоящие. Но пользователю, который спросил один раз, достаётся одна из них без предупреждения, и разница в 52 раза.

6. Год основания: где именно врёт модель без поиска

Бренд Правда DeepSeek V3 Gemini 3.5 Flash GPT-5.2
Beget 2007 98% (2 варианта) 100% (1) 100% (1)
Timeweb 2006 99% (2) 100% (1) 99% (2)
Reg.ru 2006 99% (2) 100% (1) 100% (1)
SpaceWeb 2001 84% (3) 100% (1) 100% (1)
Sprinthost 2005 5% (12) ✗ 100% (1) 100% (1)
FirstVDS 2002 0% (9) ✗ 100% (1) 81% (3)
Hostland 2003 21% (8) ✗ не называет не называет

✗ – самый частый ответ модели не совпадает с правдой.

Про Sprinthost DeepSeek назвал 12 разных годов, разброс с 2000 по 2013, а правильный 2005 прозвучал в 5% случаев. Про FirstVDS правильный год не прозвучал ни разу за 100 прогонов: девять вариантов, все неверные.

Закономерность та же, что и с составом: чем известнее бренд, тем точнее факт. Модель твёрдо знает три компании и плавает во всём остальном. Ровно там, где она плавает, и живёт большинство бизнесов.

Плюс 13 прогонов DeepSeek с прямым мусором в списке «российских хостингов»:

  • Hetzner (5 раз), Hostinger (3), A2 Hosting (1) – реальные компании, но не российские. В одном ответе модель сама написала «у A2 Hosting нет серверов в России» и всё равно оставила его в списке. Ещё в трёх прогонах появился несуществующий «Hetzner с локализацией для России».
  • AgnihostCloudHostАйхостХостинг-Телеком – не подтверждаются ни в одном каталоге хостингов. «СloudHost» модель вдобавок написала с кириллической «С» и приписала основание в 2020 году.

У Gemini и GPT-5.2 такого мусора ноль.

7. «Одна модель» – это не одна модель

Прогон DeepSeek шёл через API-роутер, и тот развёл 100 запросов по трём разным инфраструктурным провайдерам: Novita (36 запросов), DeepInfra (32), StreamLake (32). Модель везде называется одинаково.

Бренд DeepInfra Novita StreamLake
Beget / Reg.ru / Timeweb 100% 100% 100%
Sprinthost 62% 88% 71%
SpaceWeb 12% 77% 37%
FirstVDS 31% 25% 62%
Hostland 40% 0% 3%

SpaceWeb упоминается в 77% ответов у одного провайдера и в 12% у другого. Разница в шесть раз. Hostland у DeepInfra попадает в список в 40% случаев, у Novita не появляется вообще ни разу.

Один и тот же промпт, одна и та же модель, один и тот же день. Отличается только то, на чьём железе и с какой квантизацией модель физически крутится, и на это пользователь никак не влияет и об этом не знает.

Для меня это самый практический вывод из всей затеи. Если вы меряете видимость через API-роутер, часть «волатильности движка» на вашем дашборде – это лотерея роутинга, а не поведение модели.

Насколько модели вообще согласны между собой

Сравнил наборы брендов, которые каждая модель называет хотя бы в 15% прогонов:

Пара Общих брендов Jaccard Что есть только у одной
DeepSeek ↔ Gemini 6 из 8 0,75 у Gemini: AdminVPS, Nic.ru
DeepSeek ↔ GPT-5.2 6 из 8 0,75 у GPT: AdminVPS, Hoster.ru
Gemini ↔ GPT-5.2 7 из 9 0,78 Nic.ru против Hoster.ru

Согласие высокое, но неполное, и расходятся модели именно на границе – там, где решается, попадёт бренд в шорт-лист или нет.

Побочная находка: откуда GPT берёт ответ

У GPT-5.2 в ответах видны маркеры источников. В 91 прогоне из 100 он ходил в веб, и в 19 прогонах среди источников был Reddit. Остальное – обычная поисковая выдача: сайты самих хостеров и агрегаторы вроде AdminVPS и Hoster.ru (и это объясняет, почему именно они всплыли в его хвосте).

Это ровно то, о чём говорят все исследования цитируемости: пользовательский контент попадает в ответы ИИ наравне с официальными сайтами. Если про вас на Reddit написано плохо или не написано ничего, это влияет на выдачу так же, как ваша главная страница.

Что со всем этим делать

Если вы бренд. Проверяйте себя минимум на трёх моделях, а не на одной. Ядро (90-100%) означает, что вас знают. Хвост (20-50%) означает, что вас видит примерно половина спрашивающих. Ноль у одной модели при 20% у другой – это не погрешность, это разные картины мира, и лечатся они по-разному: попасть в выдачу для модели с поиском проще, чем попасть в память модели без поиска.

Если вы меряете. Один прогон это не замер, а скриншот случайного момента. Минимальная честная сетка – 10-15 прогонов на промпт, с записью частоты упоминания, а не факта упоминания. Всё, что отличается меньше чем на 10 процентных пунктов, считайте одинаковым. Отчитываясь про позицию, всегда называйте модель. И фиксируйте, какая инфраструктура отвечала.

Если вы пользуетесь нейросетью как справочником. Цифры модели без поиска придумывают заново каждый раз. В нашем замере DeepSeek сгенерировал до 31 разной цены на один тариф и ни разу не назвал правильный год основания одной из компаний.

Ограничения замера

Честно про рамки, потому что иначе выводы будут шире, чем данные.

  • Один промпт, одна ниша, один день. Это не «нейросети вообще».
  • GPT-5.2 отвечал через API, который подмешивает служебную разметку источников. В 8 прогонах из 100 она съела название пункта, поэтому его метрики состава считались на 92 читаемых прогонах. Точности фактов это не касается.
  • Gemini 3.5 Flash показал 100% точность на шести проверенных брендах. Цифра честная для этого набора, но набор узкий: модель просто называет мало компаний.
  • Разбор ответов автоматический, по регулярным выражениям, с ручной сводкой вариантов написания ( считались одним брендом). 
  • Reg.ru, REG.RU, Реги.ру, SpaceWeb
  • Существование редких брендов проверял поиском по каталогам хостингов. Если какой-то из них всё же существует, напишите, поправлю.

Я делаю Ideata – сервис, который следит за тем, что нейросети отвечают про бренды. Этот замер вырос из внутреннего спора: сколько раз надо гонять промпт, чтобы цифре можно было верить. Ответ оказался не тот, которого мы ждали – больше одного раза, но меньше, чем кажется, и совсем не поровну для разных моделей.

Хотите те же цифры по своему бренду – ideata.io/report сделает это бесплатно. Вводите домен, мы собираем реальные вопросы вашей ниши, задаём их ChatGPT, Gemini, Perplexity, Алисе и Google AI Overviews и присылаем разбор: доля видимости по каждому движку, живые цитаты ответов с подсветкой брендов, рейтинг конкурентов и список вопросов, где вас не назвал никто. Две минуты, без карты.

И сразу честно, раз уж статья про это. Бесплатный отчёт – один прогон. По нашим же данным этого хватает, чтобы понять, в ядре вы или в хвосте, но не хватает, чтобы поймать разницу в пять процентных пунктов. Так что читайте его как рентген, а не как термометр: он показывает, есть проблема или нет, а следить за динамикой – это уже регулярные прогоны.

Наши постоянные авторы и читатели делятся лайфхаками, основанными на личном опыте. Полная свобода самовыражения.

Комментарии

С помощью соцсетей
У меня нет аккаунта Зарегистрироваться
С помощью соцсетей
У меня уже есть аккаунт Войти
Инструкции по восстановлению пароля высланы на Ваш адрес электронной почты.
Пожалуйста, укажите email вашего аккаунта
Ваш баланс 10 ТК
1 ТК = 1 ₽
О том, как заработать и потратить Таймкарму, читайте в этой статье
Чтобы потратить Таймкарму, зарегистрируйтесь на нашем сайте