Ответы и источники меняются между запусками. GEO-мониторинг должен измерять распределение, а не делать вывод по одному промпту.
Команда проверяет бренд в AI-поиске «вручную»: открыли чат, задали вопрос, увидели бренд - отчитались «мы видимы». Через неделю клиент задаёт тот же вопрос - бренда нет. Что пошло не так:
Ответ генеративной модели меняется от запуска к запуску, даже при идентичном промпте.
Он меняется от переформулировки промпта и со временем.
Один замер - это точечная оценка случайной величины, а не факт.
Тезис. В классическом поиске один запрос даёт репрезентативный снимок выдачи. В генеративном поиске это допущение ломается.
Аргумент. Schulte прямо противопоставляет две парадигмы: для классического поиска «один запрос часто даёт репрезентативный снимок», но для LLM-чатов это неверно - «ответы варьируются между запусками, промптами и во времени, что делает разовые наблюдения ненадёжными».
Доказательство. Центральный методологический вклад работы - переформулировать измерение видимости из бинарной/одноточечной оценки в вероятностную характеристику, требующую многократных наблюдений в разных условиях [6].
Следствие. «Бренд упомянут / не упомянут» - это не метрика. Метрика - это доля запусков, в которых бренд упомянут, с доверительным интервалом.
Тезис. Вариативность ответа - не баг конкретной модели, а свойство всего RAG-конвейера.
Аргумент. Chen et al. показали на бенчмарке RGB, что LLM в RAG-сценарии заметно «спотыкаются» на трёх из четырёх фундаментальных способностей: negative rejection (отказ использовать нерелевантный контекст), information integration (синтез нескольких фрагментов) и counterfactual robustness (устойчивость к ложной информации в выдаче); приемлемая устойчивость есть лишь к шуму.
Доказательство. На шести репрезентативных LLM авторы заключают: несмотря на критичность этих способностей, «впереди ещё значительный путь, чтобы эффективно применять RAG к LLM» [45].
Следствие. Если модель нестабильно интегрирует и фильтрует найденные фрагменты, то и упоминание вашего бренда нестабильно от запуска к запуску - даже без изменений на вашем сайте.
Один и тот же промпт даёт разные ответы - N повторов одного промпта, считать долю упоминаний.
Перефразировка меняет retrieval и ответ - набор парафраз одного интента, агрегировать.
Индекс и модель обновляются - повторять замеры в временных окнах, отслеживать тренд.
Тезис. Видимость нужно оценивать как распределение по множеству прогонов, а не как одно значение.
Аргумент. Schulte прямо рекомендует характеризовать видимость как распределение, а не точечную оценку, и для этого вести повторяемые измерения в разных условиях [6]. Это требует автоматизации - ручной замер не масштабируется до N прогонов × M парафраз × K окон.
Доказательство. RAGAS закрывает требование автоматизации: это фреймворк reference-free оценки RAG-конвейеров без ручной разметки, ускоряющий циклы оценки архитектур. Он измеряет несколько измерений - качество ретрива (релевантность найденного контекста), достоверность генерации (насколько LLM честно опирается на пассажи) и качество самого ответа [44].
Следствие. Практический протокол замера AI visibility: (1) фиксируете интент и набор парафраз; (2) гоняете каждый промпт N раз; (3) считаете долю упоминаний бренда с интервалом; (4) повторяете во временных окнах; (5) дополняете reference-free метриками достоверности, чтобы отличать «упомянут по делу» от случайного шума.
Видимость в AI-поиске - распределение, не точка; нужны повторные замеры - препринт arXiv - https://arxiv.org/abs/2604.07585
LLM нестабильны в rejection / integration / counterfactual в RAG - препринт arXiv - https://arxiv.org/abs/2309.01431
Reference-free автоматизированная оценка RAG (faithfulness, релевантность) - рецензируемый (EACL demo) - https://aclanthology.org/2024.eacl-demo.16/
Примечание: Schulte 2026 и Chen et al. 2024 - препринты arXiv; RAGAS (Es et al., 2024) - рецензируемая публикация EACL.
Нет. Schulte (2026) показывает, что ответы варьируются между запусками, промптами и во времени, поэтому разовое наблюдение ненадёжно. Нужно множество прогонов.
Долю прогонов, в которых бренд упомянут, с доверительным интервалом, измеренную по набору парафраз промпта и по временным окнам.
Из-за стохастичности генерации и нестабильности RAG: Chen et al. (2024) показали, что LLM плохо отсеивают нерелевантный контекст и интегрируют фрагменты, поэтому вывод «плавает».
Да. RAGAS (Es et al., 2024) - фреймворк reference-free оценки RAG без ручной разметки, что позволяет гонять повторяемые замеры в масштабе.
Don't Measure Once: Measuring Visibility in AI Search. https://arxiv.org/abs/2604.07585 - препринт arXiv.
Benchmarking LLMs in Retrieval-Augmented Generation (RGB). https://arxiv.org/abs/2309.01431 - препринт arXiv.
RAGAS: Automated Evaluation of Retrieval Augmented Generation. https://aclanthology.org/2024.eacl-demo.16/ - рецензируемый (EACL demo).
Редакция Enigma
18 мая 2026
18 мая 2026
peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением
ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026)
препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте
Полный перечень источников и уровни надёжности - в каталоге исследований.