← Research Lab·Research Lab · Методология

Нестабильность AI-ответов: почему один замер вводит в заблуждение

Ответы и источники меняются между запусками. GEO-мониторинг должен измерять распределение, а не делать вывод по одному промпту.

Май 2026·6 мин чтения

Контекст / Проблема

Команда проверяет бренд в AI-поиске «вручную»: открыли чат, задали вопрос, увидели бренд - отчитались «мы видимы». Через неделю клиент задаёт тот же вопрос - бренда нет. Что пошло не так:

Ответ нестабилен

Ответ генеративной модели меняется от запуска к запуску, даже при идентичном промпте.

Зависит от формулировки

Он меняется от переформулировки промпта и со временем.

Один замер - не факт

Один замер - это точечная оценка случайной величины, а не факт.

Почему классическая логика «одного замера» здесь не работает

Тезис. В классическом поиске один запрос даёт репрезентативный снимок выдачи. В генеративном поиске это допущение ломается.

Аргумент. Schulte прямо противопоставляет две парадигмы: для классического поиска «один запрос часто даёт репрезентативный снимок», но для LLM-чатов это неверно - «ответы варьируются между запусками, промптами и во времени, что делает разовые наблюдения ненадёжными».

Доказательство. Центральный методологический вклад работы - переформулировать измерение видимости из бинарной/одноточечной оценки в вероятностную характеристику, требующую многократных наблюдений в разных условиях [6].

Следствие. «Бренд упомянут / не упомянут» - это не метрика. Метрика - это доля запусков, в которых бренд упомянут, с доверительным интервалом.

Откуда берётся нестабильность: три независимые оси

Тезис. Вариативность ответа - не баг конкретной модели, а свойство всего RAG-конвейера.

Аргумент. Chen et al. показали на бенчмарке RGB, что LLM в RAG-сценарии заметно «спотыкаются» на трёх из четырёх фундаментальных способностей: negative rejection (отказ использовать нерелевантный контекст), information integration (синтез нескольких фрагментов) и counterfactual robustness (устойчивость к ложной информации в выдаче); приемлемая устойчивость есть лишь к шуму.

Доказательство. На шести репрезентативных LLM авторы заключают: несмотря на критичность этих способностей, «впереди ещё значительный путь, чтобы эффективно применять RAG к LLM» [45].

Следствие. Если модель нестабильно интегрирует и фильтрует найденные фрагменты, то и упоминание вашего бренда нестабильно от запуска к запуску - даже без изменений на вашем сайте.

Три оси вариативности (свести в систему измерения)

Стохастичность запусков

Один и тот же промпт даёт разные ответы - N повторов одного промпта, считать долю упоминаний.

Формулировка промпта

Перефразировка меняет retrieval и ответ - набор парафраз одного интента, агрегировать.

Время

Индекс и модель обновляются - повторять замеры в временных окнах, отслеживать тренд.

Как мерить правильно: повторяемость, окна, вероятностные метрики

Тезис. Видимость нужно оценивать как распределение по множеству прогонов, а не как одно значение.

Аргумент. Schulte прямо рекомендует характеризовать видимость как распределение, а не точечную оценку, и для этого вести повторяемые измерения в разных условиях [6]. Это требует автоматизации - ручной замер не масштабируется до N прогонов × M парафраз × K окон.

Доказательство. RAGAS закрывает требование автоматизации: это фреймворк reference-free оценки RAG-конвейеров без ручной разметки, ускоряющий циклы оценки архитектур. Он измеряет несколько измерений - качество ретрива (релевантность найденного контекста), достоверность генерации (насколько LLM честно опирается на пассажи) и качество самого ответа [44].

Следствие. Практический протокол замера AI visibility: (1) фиксируете интент и набор парафраз; (2) гоняете каждый промпт N раз; (3) считаете долю упоминаний бренда с интервалом; (4) повторяете во временных окнах; (5) дополняете reference-free метриками достоверности, чтобы отличать «упомянут по делу» от случайного шума.

E-E-A-T: на чём основаны утверждения

Schulte, 2026

Видимость в AI-поиске - распределение, не точка; нужны повторные замеры - препринт arXiv - https://arxiv.org/abs/2604.07585

Chen et al., 2024 (RGB)

LLM нестабильны в rejection / integration / counterfactual в RAG - препринт arXiv - https://arxiv.org/abs/2309.01431

Es et al., 2024

Reference-free автоматизированная оценка RAG (faithfulness, релевантность) - рецензируемый (EACL demo) - https://aclanthology.org/2024.eacl-demo.16/

Примечание: Schulte 2026 и Chen et al. 2024 - препринты arXiv; RAGAS (Es et al., 2024) - рецензируемая публикация EACL.

Частые вопросы

Достаточно ли спросить ChatGPT один раз, чтобы проверить видимость бренда?

Нет. Schulte (2026) показывает, что ответы варьируются между запусками, промптами и во времени, поэтому разовое наблюдение ненадёжно. Нужно множество прогонов.

Что считать метрикой AI visibility вместо «упомянут/не упомянут»?

Долю прогонов, в которых бренд упомянут, с доверительным интервалом, измеренную по набору парафраз промпта и по временным окнам.

Почему ответ меняется, хотя я ничего не менял на сайте?

Из-за стохастичности генерации и нестабильности RAG: Chen et al. (2024) показали, что LLM плохо отсеивают нерелевантный контекст и интегрируют фрагменты, поэтому вывод «плавает».

Можно ли автоматизировать такую оценку?

Да. RAGAS (Es et al., 2024) - фреймворк reference-free оценки RAG без ручной разметки, что позволяет гонять повторяемые замеры в масштабе.

Источники (E-E-A-T)

06 · Schulte, 2026

Don't Measure Once: Measuring Visibility in AI Search. https://arxiv.org/abs/2604.07585 - препринт arXiv.

45 · Chen et al., 2024

Benchmarking LLMs in Retrieval-Augmented Generation (RGB). https://arxiv.org/abs/2309.01431 - препринт arXiv.

44 · Es et al., 2024

RAGAS: Automated Evaluation of Retrieval Augmented Generation. https://aclanthology.org/2024.eacl-demo.16/ - рецензируемый (EACL demo).

Как мы проверяли материал

Автор

Редакция Enigma

Опубликовано

18 мая 2026

Обновлено

18 мая 2026

Источники

peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением

Сверка

ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026)

Оговорка

препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте

Полный перечень источников и уровни надёжности - в каталоге исследований.