← Тренды AI-поиска·Блог · Тренды AI-поиска

Почему цитата в AI-ответе не всегда означает влияние

Ссылка под ответом ChatGPT или Perplexity - это не доказательство того, что ваш текст сформировал ответ. Эта статья показывает, где проходит граница между «нас процитировали» и «нас действительно использовали».

Май 2026·8 мин чтения

Контекст / Проблема

Маркетологи и контент-команды меряют успех в AI-поиске по одному числу - сколько раз домен попал в список цитат. Проблема в том, что это число почти ничего не говорит о реальном вкладе страницы. Конкретная боль:

Цитата без формулировок

Страница в списке источников, но в тексте ответа - ноль ваших формулировок и фактов.

Бюджет под попадание, не влияние

Бюджет на контент оптимизируется под «попадание в цитаты», а не под влияние на ответ.

Рост цитат без узнаваемости

Невозможно объяснить руководству, почему рост цитирований не двигает узнаваемость.

Три разных события, которые путают в одно

Цитата в AI-ответе - это не один процесс, а цепочка из трёх независимых событий. Сбой или успех на каждом этапе не предсказывает остальные.

1. Citation selection - платформа выбрала источник

Тезис: выбор источника - это решение ретривера, а не свидетельство его полезности. Аргумент: модель сначала запускает поиск и отбирает страницы по семантической близости к запросу, и только потом решает, что с ними делать. Доказательство: в работе From Citation Selection to Citation Absorption (Zhang, He, Yao, 2026, препринт) selection прямо определяется как этап, на котором «платформа запускает поиск и выбирает источники», отдельно от того, попадёт ли источник в ответ [7].

2. Source attribution - модель приписала утверждению ссылку

Тезис: пристёгнутая к предложению ссылка - это заявление модели, а не проверенный факт. Аргумент: LLM генерирует маркер как часть текста, и этот маркер может не подтверждать само утверждение. Доказательство: в бенчмарке ALCE (Gao, Yen, Yu, Chen, 2023, рецензируемая статья, EMNLP) показано, что на датасете ELI5 даже лучшие модели не имеют полной поддержки цитат в 50% случаев - половина «ссылок» не подкрепляет заявленное [32].

50%
ссылок без полной поддержки
БЕНЧМАРК ALCE

На датасете ELI5 даже лучшие модели не имеют полной поддержки цитат в 50% случаев - половина ссылок не подкрепляет заявленное [32].

3. Answer absorption - источник реально сформировал ответ

Тезис: влияние - это когда страница отдала в ответ язык, факты, структуру или доказательства. Аргумент: вероятную абсорбцию оценивают не по наличию ссылки, а по вкладу источника в итоговый текст. Доказательство: тот же препринт Zhang et al. определяет absorption как ситуацию, когда «цитируемая страница вносит язык, доказательства, структуру или фактическую поддержку в финальный ответ», и это отдельная метрика от факта цитирования [7].

Важно: прямое измерение absorption требует доступа к внутренним сигналам модели (как в MIRAGE-подходе), что недоступно для закрытых платформ; внешние инструменты оценивают вероятную absorption косвенно - по совпадению языка, фактов и структуры ответа с источником, а не как гарантированное знание внутреннего механизма.

Почему selection и absorption расходятся на практике

Тезис: платформа может цитировать широко, но впитывать узко. Аргумент: разные движки по-разному балансируют охват и глубину цитирования. Доказательство: в исследовании Zhang et al. на 602 контролируемых промптах и 21 143 цитатах по трём платформам Perplexity и Google AI Overview цитируют больше источников в среднем, тогда как ChatGPT цитирует меньше, но показывает «существенно более высокое среднее влияние цитат среди извлечённых страниц» [7].

Тезис: правильная цитата ≠ честная цитата. Аргумент: ссылка может вести на источник, который действительно содержит факт, но при этом модель пришла к ответу не из него. Это различие correctness vs. faithfulness, на котором настаивает работа Correctness is not Faithfulness in RAG Attributions (Wallat et al., 2024/2025, рецензируемая, ACM Digital Library): корректность атрибуции не равна тому, что источник реально использовался при генерации [39]. Примечание: полный текст этого источника был недоступен на момент написания; здесь воспроизводится только заявленное в заголовке концептуальное различие, без числовых данных.

Тезис: чтобы узнать реальное влияние, нужно смотреть внутрь модели, а не на её ссылки. Аргумент: атрибуция по внутренним состояниям отвязывается от того, что модель «решила» процитировать. Доказательство: метод MIRAGE (Qi et al., 2024, рецензируемая, EMNLP) определяет токены ответа, чувствительные к контексту, и связывает их с документами, реально повлиявшими на предсказание через saliency-методы - потому что self-citation «не отражает достоверно использование контекста моделью» [40].

Что отличает страницу, которую реально поглощают

Тезис: впитываются не «оптимизированные», а извлекаемые страницы. Аргумент: модели тянут в ответ конкретные единицы смысла, а не общую релевантность. Доказательство: Zhang et al. (препринт) выделяют у высоковлиятельных страниц набор признаков - большая длина, чёткая структура, семантическое соответствие запросу и насыщенность извлекаемыми доказательствами: определениями, числовыми фактами, сравнениями, пошаговыми процедурами [7].

Citation selection

Ретривер отобрал страницу - попадание в список источников - Источник 7 (препринт).

Source attribution

Модель пристегнула маркер к фразе - precision/recall цитат, поддержка утверждения - Источник 32 (EMNLP), Источник 39 (ACM).

Answer absorption

Текст ответа сформирован страницей - вклад языка/фактов/структуры; внутренняя saliency - Источник 7 (препринт), Источник 40 (EMNLP).

E-E-A-T: на чём основаны выводы

07 - Zhang, He, Yao (2026)

From Citation Selection to Citation Absorption - препринт (arXiv) - вводит различие selection vs. absorption; 602 промпта, 21 143 цитаты, 3 платформы [7].

32 - Gao, Yen, Yu, Chen (2023)

Enabling LLMs to Generate Text with Citations - рецензируемая (EMNLP) - бенчмарк ALCE; на ELI5 нет полной поддержки цитат в 50% случаев [32].

39 - Wallat et al. (2024/2025)

Correctness is not Faithfulness in RAG Attributions - рецензируемая (ACM DL) - различие correctness vs. faithfulness атрибуции (полный текст недоступен) [39].

40 - Qi et al. (2024)

Model Internals-based Answer Attribution / MIRAGE - рецензируемая (EMNLP) - атрибуция по внутренним состояниям модели вместо self-citation [40].

Частые вопросы

Цитирование моего сайта в Perplexity означает, что он повлиял на ответ?

Нет. Это citation selection - ретривер отобрал страницу. Влияние (absorption) - отдельное событие, при котором текст страницы реально попал в ответ. Вероятную absorption можно оценить только косвенно без доступа к внутренним сигналам модели.

Почему модель ставит ссылку, не подтверждающую утверждение?

Маркер цитаты - часть генерируемого текста, а не проверенный факт. По бенчмарку ALCE, даже лучшие модели на ELI5 не имеют полной поддержки цитат в 50% случаев.

Как вообще узнать, что источник реально повлиял?

Через атрибуцию по внутренним состояниям модели. Метод MIRAGE связывает токены ответа с документами, действительно повлиявшими на предсказание, минуя ненадёжные self-citation модели.

Что делает страницу «поглощаемой»?

Длина, чёткая структура, семантическое соответствие запросу и плотность извлекаемых доказательств: определений, чисел, сравнений и пошаговых инструкций.

Как мы проверяли материал

Автор

Редакция Enigma.

Опубликовано

18 мая 2026.

Обновлено

18 мая 2026.

Источники

peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением.

Сверка

ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026).

Оговорка

препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте.

Полный перечень источников и уровни надёжности - в каталоге исследований.

Источники (E-E-A-T)

07 · Zhang, He, Yao, 2026

From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms. https://arxiv.org/abs/2604.25707 - препринт.

32 · Gao, Yen, Yu, Chen, 2023

Enabling Large Language Models to Generate Text with Citations. https://aclanthology.org/2023.emnlp-main.398/ - рецензируемая (EMNLP).

39 · Wallat et al., 2024/2025

Correctness is not Faithfulness in RAG Attributions. https://dl.acm.org/doi/10.1145/3731120.3744592 - рецензируемая (ACM DL).

40 · Qi et al., 2024

Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation. https://aclanthology.org/2024.emnlp-main.347/ - рецензируемая (EMNLP).