AI-видимость нельзя оценивать одним ключом. Нужен набор вопросов вокруг intent: бренд, категория, сравнение, покупка, проблема и авторитет источников.
Один ключ не описывает весь спрос. Пользователь спрашивает разными словами, а answer engine может выбрать разные источники под каждую формулировку. Поэтому GEO-аудит начинается с prompt/query cluster, а не с одиночной фразы.
Natural Questions построен на реальных вопросах пользователей [30], а BEIR показывает, что retrieval-качество зависит от типа задачи и домена [28]. Практический вывод: тестовый набор должен покрывать несколько intent-типов, иначе замер будет случайным.
Видит ли модель бренд по прямому вопросу.
Появляется ли бренд в списке решений категории.
Как бренд описывается рядом с альтернативами.
Рекомендуют ли бренд при выборе поставщика или продукта.
Появляется ли бренд до того, как пользователь назвал категорию.
Какие внешние источники подтверждают или вытесняют бренд.
Каждый prompt должен возвращать не только mention, но и цитаты, конкурентов, позицию бренда, тональность и фрагмент ответа. Только так cluster становится backlog: какие страницы написать, какие факты подтвердить, какие внешние источники усилить.
Для лёгкого baseline достаточно 6 intent-кластеров по нескольким моделям. Один промпт не репрезентирует видимость.
SEO-ключи полезны как вход, но промпты должны звучать как естественные вопросы и задачи пользователя.
Группировать gaps по intent: где нужна brand facts page, comparison page, FAQ, методология или внешний authority source.
BEIR benchmark for retrieval. https://arxiv.org/abs/2104.08663
Natural Questions: real user questions. https://ai.google.com/research/NaturalQuestions
ORCAS: query-document click pairs for search research. https://arxiv.org/abs/2006.05324