Один запит до ChatGPT - це не замір видимості, а одне спостереження з розподілу. Видимість в AI-пошуку - це розподіл, і вимірювати її потрібно як розподіл.
Команда перевіряє бренд в AI-пошуку «вручну»: відкрили чат, поставили питання, побачили бренд - відзвітували «ми видимі». За тиждень клієнт ставить те саме питання - бренду немає. Що пішло не так:
Відповідь генеративної моделі змінюється від запуску до запуску, навіть за ідентичного промпта.
Вона змінюється від переформулювання промпта і з часом.
Один замір - це точкова оцінка випадкової величини, а не факт.
Теза. У класичному пошуку один запит часто дає більш стабільний знімок видачі, хоча локація, персоналізація і час також можуть впливати. У генеративному пошуку це припущення ламається.
Аргумент. Schulte прямо протиставляє дві парадигми: для класичного пошуку «один запит часто дає репрезентативний знімок», але для LLM-чатів це невірно - «відповіді варіюються між запусками, промптами і в часі, що робить разові спостереження ненадійними».
Доказ. Центральний методологічний внесок роботи - переформулювати вимірювання видимості з бінарної/одноточкової оцінки у ймовірнісну характеристику, що вимагає багаторазових спостережень у різних умовах [6].
Наслідок. «Бренд згаданий / не згаданий» - це не метрика. Метрика - це частка запусків, у яких бренд згаданий, з довірчим інтервалом.
Теза. Варіативність відповіді - не баг конкретної моделі, а властивість усього RAG-конвеєра.
Аргумент. Chen et al. показали на бенчмарку RGB, що LLM у RAG-сценарії помітно «спотикаються» на трьох із чотирьох фундаментальних здібностей: negative rejection (відмова використовувати нерелевантний контекст), information integration (синтез кількох фрагментів) і counterfactual robustness (стійкість до хибної інформації у видачі); прийнятна стійкість є лише до шуму.
Доказ. На шести репрезентативних LLM автори роблять висновок: попри критичність цих здібностей, «попереду ще значний шлях, щоб ефективно застосовувати RAG до LLM» [45].
Наслідок. Якщо модель нестабільно інтегрує і фільтрує знайдені фрагменти, то й згадка вашого бренду нестабільна від запуску до запуску - навіть без змін на вашому сайті.
Один і той самий промпт дає різні відповіді - N повторів одного промпта, рахувати частку згадок.
Перефразування змінює retrieval і відповідь - набір парафраз одного інтенту, агрегувати.
Індекс і модель оновлюються - повторювати заміри в часових вікнах, відстежувати тренд.
Теза. Видимість потрібно оцінювати як розподіл за множиною прогонів, а не як одне значення.
Аргумент. Schulte прямо рекомендує характеризувати видимість як розподіл, а не точкову оцінку, і для цього вести повторювані вимірювання в різних умовах [6]. Це вимагає автоматизації - ручний замір не масштабується до N прогонів × M парафраз × K вікон.
Доказ. RAGAS закриває вимогу автоматизації: це фреймворк reference-free оцінки RAG-конвеєрів без ручної розмітки, що пришвидшує цикли оцінки архітектур. Він вимірює кілька вимірів - якість ретриву (релевантність знайденого контексту), достовірність генерації (наскільки LLM чесно спирається на пасажі) і якість самої відповіді [44].
Наслідок. Практичний протокол заміру AI visibility: (1) фіксуєте інтент і набір парафраз; (2) запускаєте кожен промпт N разів; (3) рахуєте частку згадок бренду з інтервалом; (4) повторюєте в часових вікнах; (5) доповнюєте reference-free метриками достовірності, щоб відрізняти «згаданий по справі» від випадкового шуму.
Видимість в AI-пошуку - розподіл, не точка; потрібні повторні заміри - препринт arXiv - https://arxiv.org/abs/2604.07585
LLM нестабільні в rejection / integration / counterfactual у RAG - препринт arXiv - https://arxiv.org/abs/2309.01431
Reference-free автоматизована оцінка RAG (faithfulness, релевантність) - рецензований (EACL demo) - https://aclanthology.org/2024.eacl-demo.16/
Примітка: Schulte 2026 і Chen et al. 2024 - препринти arXiv; RAGAS (Es et al., 2024) - рецензована публікація EACL.
Ні. Schulte (2026) показує, що відповіді варіюються між запусками, промптами і в часі, тому разове спостереження ненадійне. Потрібна множина прогонів.
Частку прогонів, у яких бренд згаданий, з довірчим інтервалом, виміряну за набором парафраз промпта і за часовими вікнами.
Через стохастичність генерації і нестабільність RAG: Chen et al. (2024) показали, що LLM погано відсіюють нерелевантний контекст й інтегрують фрагменти, тому висновок «плаває».
Так. RAGAS (Es et al., 2024) - фреймворк reference-free оцінки RAG без ручної розмітки, що дозволяє ганяти повторювані заміри в масштабі.
Don't Measure Once: Measuring Visibility in AI Search. https://arxiv.org/abs/2604.07585 - препринт arXiv.
Benchmarking LLMs in Retrieval-Augmented Generation (RGB). https://arxiv.org/abs/2309.01431 - препринт arXiv.
RAGAS: Automated Evaluation of Retrieval Augmented Generation. https://aclanthology.org/2024.eacl-demo.16/ - рецензований (EACL demo).
Редакція Enigma
18 травня 2026
19 травня 2026
peer-reviewed, препринти та industry research - тип указано поряд із кожним твердженням
ключові тези звірені з актуальною документацією Google Search Central (травень 2026)
препринти та галузеві звіти наведені з методологічними обмеженнями; перевіряйте висновки на своєму проєкті
Повний перелік джерел і рівні надійності - у каталозі досліджень.