← GEO Playbook·GEO Playbook · Розділ 05

Чому AI-видимість нестабільна - і як її вимірювати правильно

Відповіді AI і набір цитованих джерел змінюються між запусками. Один замір дає хибну картину. Цей розділ задає логіку повторюваного вимірювання.

6 хв читання

Перевірка одного промпту один раз ≠ ваша позиція в AI-пошуку. Той самий запит у різні дні дає різні відповіді й різні джерела. Без повторюваних замірів неможливо відрізнити сигнал від шуму.

Один замір вводить в оману

Видимість у AI-пошуку - імовірнісна, не фіксована. Schulte показує, що відповіді AI-пошуковиків і набори цитованих джерел нестабільні між запусками, тож один замір може давати хибне уявлення про позицію бренду [6]. Висновок прямий: моніторинг - це повторюваний замір, а не разова перевірка промпту.

Чому зник прямий зворотний звʼязок

У класичному web search кліки й dwell time можуть використовуватись як fine-grained feedback для покращення ranking-моделей; у генеративному пошуку зворотний звʼязок часто привʼязаний до фінальної відповіді, тому його важче мапити на етапи retrieval/generation. Dai et al. пропонують повернути fine-grained feedback на етапи decomposition, retrieval і generation [20]. Тому видимість залежить не тільки від документа, а й від поведінки на етапах AI-пошуку.

Що саме вимірювати

Якщо результат нестабільний, метрика має бути розподілом, а не точкою.

Кілька прогонів одного промпту

Відповіді змінюються між запусками [6].

Кілька днів / часові вікна

Видимість дрейфує в часі [6].

Кілька платформ

Набори джерел відрізняються між системами.

Набір промптів, не один

Один запит не репрезентує intent-кластер.

Метрики з RAG-evaluation

Оцінювати треба не лише факт згадки, а й якість використання джерела. Огляд оцінювання RAG дає набір вимірів: релевантність, точність, підтримка тверджень, стійкість [36]. RAGAS формалізує метрики faithfulness, answer relevancy і context relevance для RAG-пайплайнів [44]. Їх можна адаптувати для GEO-дашборда, але це не готовий стандарт: dashboard має окремо фіксувати platform, prompt set, run count і citation/absorption.

Один контент - різні системи

Та сама сторінка по-різному поводиться в різних продуктах. Бенчмарк Chen et al. показує, що один і той самий контекст моделі використовують неоднаково: точність і помилки відрізняються між моделями [45]. Тож share of voice спершу рахуємо окремо для кожної платформи (platform-level breakdown); агрегований показник допустимий лише як вторинний шар поверх цього розбиття, а не замість нього.

Джерела (E-E-A-T)

06 · Schulte, 2026, arXiv

Відповіді й цитати нестабільні між запусками. arxiv.org/abs/2604.07585

20 · Dai et al., 2025, SIGIR

Зворотний звʼязок у генеративному пошуку ослаб. arxiv.org/abs/2505.14680

36 · Yu et al., 2024, arXiv

Набір вимірів для оцінювання RAG. arxiv.org/abs/2405.07437

44 · Es et al., 2024, EACL Demo

RAGAS: faithfulness, relevancy, context relevance. aclanthology.org/2024.eacl-demo.16/

45 · Chen et al., 2024, AAAI

Моделі по-різному використовують той самий контекст. arxiv.org/abs/2309.01431

Часті питання

Чому відповідь AI про мій бренд щоразу інша?

Бо відповіді й набір цитованих джерел нестабільні між запусками - це властивість генеративного пошуку, а не помилка [6].

Скільки разів треба перевіряти видимість?

Багаторазово: кілька прогонів одного промпту, кілька днів і кілька платформ. Один замір методологічно слабкий і може давати хибну картину; статистичну надійність задають через протокол повторів (кількість прогонів, вікна, дисперсія) [6].

Чому не можна усереднити видимість «по всіх AI»?

Бо різні системи по-різному використовують той самий контент; точність і набір джерел відрізняються між моделями [45]. Share of voice рахують окремо для кожної платформи.

Які метрики брати для GEO-дашборда?

Faithfulness, answer relevancy і context relevance з RAG-evaluation - адаптовані, не як готовий стандарт; рахувати на повторюваних замірах і фіксувати platform, prompt set, run count, citation/absorption [36, 44].