Ссылка в AI-ответе ещё не доказывает, что источник повлиял на смысл ответа. Важно различать selection, absorption и faithfulness.
Маркетологи и контент-команды меряют успех в AI-поиске по одному числу - сколько раз домен попал в список цитат. Проблема в том, что это число почти ничего не говорит о реальном вкладе страницы. Конкретная боль:
Страница в списке источников, но в тексте ответа - ноль ваших формулировок и фактов.
Бюджет на контент оптимизируется под «попадание в цитаты», а не под влияние на ответ.
Невозможно объяснить руководству, почему рост цитирований не двигает узнаваемость.
Цитата в AI-ответе - это не один процесс, а цепочка из трёх независимых событий. Сбой или успех на каждом этапе не предсказывает остальные.
Тезис: выбор источника - это решение ретривера, а не свидетельство его полезности. Аргумент: модель сначала запускает поиск и отбирает страницы по семантической близости к запросу, и только потом решает, что с ними делать. Доказательство: в работе From Citation Selection to Citation Absorption (Zhang, He, Yao, 2026, препринт) selection прямо определяется как этап, на котором «платформа запускает поиск и выбирает источники», отдельно от того, попадёт ли источник в ответ [7].
Тезис: пристёгнутая к предложению ссылка - это заявление модели, а не проверенный факт. Аргумент: LLM генерирует маркер как часть текста, и этот маркер может не подтверждать само утверждение. Доказательство: в бенчмарке ALCE (Gao, Yen, Yu, Chen, 2023, рецензируемая статья, EMNLP) показано, что на датасете ELI5 даже лучшие модели не имеют полной поддержки цитат в 50% случаев - половина «ссылок» не подкрепляет заявленное [32].
На датасете ELI5 даже лучшие модели не имеют полной поддержки цитат в 50% случаев - половина ссылок не подкрепляет заявленное [32].
Тезис: влияние - это когда страница отдала в ответ язык, факты, структуру или доказательства. Аргумент: вероятную абсорбцию оценивают не по наличию ссылки, а по вкладу источника в итоговый текст. Доказательство: тот же препринт Zhang et al. определяет absorption как ситуацию, когда «цитируемая страница вносит язык, доказательства, структуру или фактическую поддержку в финальный ответ», и это отдельная метрика от факта цитирования [7].
Важно: прямое измерение absorption требует доступа к внутренним сигналам модели (как в MIRAGE-подходе), что недоступно для закрытых платформ; внешние инструменты оценивают вероятную absorption косвенно - по совпадению языка, фактов и структуры ответа с источником, а не как гарантированное знание внутреннего механизма.
Тезис: платформа может цитировать широко, но впитывать узко. Аргумент: разные движки по-разному балансируют охват и глубину цитирования. Доказательство: в исследовании Zhang et al. на 602 контролируемых промптах и 21 143 цитатах по трём платформам Perplexity и Google AI Overview цитируют больше источников в среднем, тогда как ChatGPT цитирует меньше, но показывает «существенно более высокое среднее влияние цитат среди извлечённых страниц» [7].
Тезис: правильная цитата ≠ честная цитата. Аргумент: ссылка может вести на источник, который действительно содержит факт, но при этом модель пришла к ответу не из него. Это различие correctness vs. faithfulness, на котором настаивает работа Correctness is not Faithfulness in RAG Attributions (Wallat et al., 2024/2025, рецензируемая, ACM Digital Library): корректность атрибуции не равна тому, что источник реально использовался при генерации [39]. Примечание: полный текст этого источника был недоступен на момент написания; здесь воспроизводится только заявленное в заголовке концептуальное различие, без числовых данных.
Тезис: чтобы узнать реальное влияние, нужно смотреть внутрь модели, а не на её ссылки. Аргумент: атрибуция по внутренним состояниям отвязывается от того, что модель «решила» процитировать. Доказательство: метод MIRAGE (Qi et al., 2024, рецензируемая, EMNLP) определяет токены ответа, чувствительные к контексту, и связывает их с документами, реально повлиявшими на предсказание через saliency-методы - потому что self-citation «не отражает достоверно использование контекста моделью» [40].
Тезис: впитываются не «оптимизированные», а извлекаемые страницы. Аргумент: модели тянут в ответ конкретные единицы смысла, а не общую релевантность. Доказательство: Zhang et al. (препринт) выделяют у высоковлиятельных страниц набор признаков - большая длина, чёткая структура, семантическое соответствие запросу и насыщенность извлекаемыми доказательствами: определениями, числовыми фактами, сравнениями, пошаговыми процедурами [7].
Ретривер отобрал страницу - попадание в список источников - Источник 7 (препринт).
Модель пристегнула маркер к фразе - precision/recall цитат, поддержка утверждения - Источник 32 (EMNLP), Источник 39 (ACM).
Текст ответа сформирован страницей - вклад языка/фактов/структуры; внутренняя saliency - Источник 7 (препринт), Источник 40 (EMNLP).
From Citation Selection to Citation Absorption - препринт (arXiv) - вводит различие selection vs. absorption; 602 промпта, 21 143 цитаты, 3 платформы [7].
Enabling LLMs to Generate Text with Citations - рецензируемая (EMNLP) - бенчмарк ALCE; на ELI5 нет полной поддержки цитат в 50% случаев [32].
Correctness is not Faithfulness in RAG Attributions - рецензируемая (ACM DL) - различие correctness vs. faithfulness атрибуции (полный текст недоступен) [39].
Model Internals-based Answer Attribution / MIRAGE - рецензируемая (EMNLP) - атрибуция по внутренним состояниям модели вместо self-citation [40].
Нет. Это citation selection - ретривер отобрал страницу. Влияние (absorption) - отдельное событие, при котором текст страницы реально попал в ответ. Вероятную absorption можно оценить только косвенно без доступа к внутренним сигналам модели.
Маркер цитаты - часть генерируемого текста, а не проверенный факт. По бенчмарку ALCE, даже лучшие модели на ELI5 не имеют полной поддержки цитат в 50% случаев.
Через атрибуцию по внутренним состояниям модели. Метод MIRAGE связывает токены ответа с документами, действительно повлиявшими на предсказание, минуя ненадёжные self-citation модели.
Длина, чёткая структура, семантическое соответствие запросу и плотность извлекаемых доказательств: определений, чисел, сравнений и пошаговых инструкций.
Редакция Enigma.
18 мая 2026.
18 мая 2026.
peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением.
ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026).
препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте.
Полный перечень источников и уровни надёжности - в каталоге исследований.
From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms. https://arxiv.org/abs/2604.25707 - препринт.
Enabling Large Language Models to Generate Text with Citations. https://aclanthology.org/2023.emnlp-main.398/ - рецензируемая (EMNLP).
Correctness is not Faithfulness in RAG Attributions. https://dl.acm.org/doi/10.1145/3731120.3744592 - рецензируемая (ACM DL).
Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation. https://aclanthology.org/2024.emnlp-main.347/ - рецензируемая (EMNLP).