← Тренди AI-пошуку·Блог · Тренди AI-пошуку

Чому цитата в AI-відповіді не завжди означає вплив

Посилання під відповіддю ChatGPT або Perplexity - це не доказ того, що ваш текст сформував відповідь. Ця стаття показує, де проходить межа між «нас процитували» і «нас справді використали».

Травень 2026·8 хв читання

Контекст / Проблема

Маркетологи і контент-команди міряють успіх в AI-пошуку за одним числом - скільки разів домен потрапив у список цитат. Проблема в тому, що це число майже нічого не говорить про реальний внесок сторінки. Конкретний біль:

Цитата без формулювань

Сторінка в списку джерел, але в тексті відповіді - нуль ваших формулювань і фактів.

Бюджет під потрапляння, не вплив

Бюджет на контент оптимізується під «потрапляння в цитати», а не під вплив на відповідь.

Зростання цитат без впізнаваності

Неможливо пояснити керівництву, чому зростання цитувань не рухає впізнаваність.

Три різні події, які плутають в одне

Цитата в AI-відповіді - це не один процес, а ланцюг із трьох окремих, але пов’язаних подій. Успіх на одному етапі не гарантує успіху на наступному.

1. Citation selection - платформа обрала джерело

Теза: вибір джерела - це рішення retrieval/ranking pipeline платформи, а не пряме свідчення корисності джерела. Аргумент: модель спочатку запускає пошук і відбирає сторінки за семантичною близькістю до запиту, і лише потім вирішує, що з ними робити. Доказ: у роботі From Citation Selection to Citation Absorption (Zhang, He, Yao, 2026, препринт) selection прямо визначається як етап, на якому «платформа запускає пошук і обирає джерела», окремо від того, чи потрапить джерело у відповідь [7].

2. Source attribution - модель приписала твердженню посилання

Теза: пристебнуте до речення посилання - це заява моделі, а не перевірений факт. Аргумент: у багатьох cited-generation або RAG-системах маркер цитати є частиною згенерованого або постобробленого output; тому він може не підтверджувати конкретне твердження. Доказ: у бенчмарку ALCE (Gao, Yen, Yu, Chen, 2023, рецензована стаття, EMNLP) показано, що на датасеті ELI5 навіть найкращі моделі не мають повної підтримки цитат у 50% випадків - половина «посилань» не підкріплює заявлене [32].

50%
посилань без повної підтримки
БЕНЧМАРК ALCE

На датасеті ELI5 навіть найкращі моделі не мають повної підтримки цитат у 50% випадків - половина посилань не підкріплює заявлене [32].

3. Answer absorption - джерело реально сформувало відповідь

Теза: вплив - це коли сторінка віддала у відповідь мову, факти, структуру або докази. Аргумент: ймовірну абсорбцію оцінюють не за наявністю посилання, а за внеском джерела в підсумковий текст. Доказ: той самий препринт Zhang et al. визначає absorption як ситуацію, коли «цитована сторінка вносить мову, докази, структуру або фактичну підтримку у фінальну відповідь», і це окрема метрика від факту цитування [7].

Важливо: пряме вимірювання absorption вимагає доступу до внутрішніх сигналів моделі (як у MIRAGE-підході), що недоступно для закритих платформ; зовнішні інструменти оцінюють ймовірну absorption опосередковано - за збігом мови, фактів і структури відповіді з джерелом, а не як гарантоване знання внутрішнього механізму.

Чому selection і absorption розходяться на практиці

Теза: платформа може цитувати широко, але вбирати вузько. Аргумент: різні рушії по-різному балансують охоплення і глибину цитування. Доказ: у дослідженні Zhang et al. на 602 контрольованих промптах і 21 143 цитатах за трьома платформами Perplexity і Google AI Overview цитують більше джерел у середньому, тоді як ChatGPT цитує менше, але показує «суттєво вищий середній вплив цитат серед видобутих сторінок» [7].

Теза: правильна цитата ≠ чесна цитата. Аргумент: посилання може вести на джерело, яке справді містить факт, але при цьому модель дійшла до відповіді не з нього. Це різниця correctness vs. faithfulness, на якій наполягає робота Correctness is not Faithfulness in RAG Attributions (Wallat et al., 2024/2025, рецензована, ACM Digital Library): коректність атрибуції не дорівнює тому, що джерело реально використовувалося при генерації [39]. Примітка: повний текст цього джерела був недоступний на момент написання; тут відтворюється лише заявлена в заголовку концептуальна різниця, без числових даних.

Теза: щоб дізнатися реальний вплив, потрібно дивитися всередину моделі, а не на її посилання. Аргумент: атрибуція за внутрішніми станами відв’язується від того, що модель «вирішила» процитувати. Доказ: метод MIRAGE (Qi et al., 2024, рецензована, EMNLP) визначає токени відповіді, чутливі до контексту, і пов’язує їх з документами, що реально вплинули на передбачення через saliency-методи - тому що self-citation «не відображає достовірно використання контексту моделлю» [40].

Що відрізняє сторінку, яку реально поглинають

Теза: вбираються не «оптимізовані», а видобувні сторінки. Аргумент: моделі тягнуть у відповідь конкретні одиниці змісту, а не загальну релевантність. Доказ: Zhang et al. (препринт) виділяють у високовпливових сторінок набір ознак - велика довжина, чітка структура, семантична відповідність запиту і насиченість видобувними доказами: визначеннями, числовими фактами, порівняннями, покроковими процедурами [7].

Citation selection

Ретривер відібрав сторінку - потрапляння в список джерел - Джерело 7 (препринт).

Source attribution

Модель пристебнула маркер до фрази - precision/recall цитат, підтримка твердження - Джерело 32 (EMNLP), Джерело 39 (ACM).

Answer absorption

Текст відповіді сформований сторінкою - внесок мови/фактів/структури; внутрішня saliency - Джерело 7 (препринт), Джерело 40 (EMNLP).

E-E-A-T: на чому ґрунтуються висновки

07 - Zhang, He, Yao (2026)

From Citation Selection to Citation Absorption - препринт (arXiv) - вводить різницю selection vs. absorption; 602 промпти, 21 143 цитати, 3 платформи [7].

32 - Gao, Yen, Yu, Chen (2023)

Enabling LLMs to Generate Text with Citations - рецензована (EMNLP) - бенчмарк ALCE; на ELI5 немає повної підтримки цитат у 50% випадків [32].

39 - Wallat et al. (2024/2025)

Correctness is not Faithfulness in RAG Attributions - рецензована (ACM DL) - різниця correctness vs. faithfulness атрибуції (повний текст недоступний) [39].

40 - Qi et al. (2024)

Model Internals-based Answer Attribution / MIRAGE - рецензована (EMNLP) - атрибуція за внутрішніми станами моделі замість self-citation [40].

Часті питання

Цитування мого сайту в Perplexity означає, що він вплинув на відповідь?

Ні. Це citation selection - ретривер відібрав сторінку. Вплив (absorption) - окрема подія, за якої текст сторінки реально потрапив у відповідь. Ймовірну absorption можна оцінити лише опосередковано без доступу до внутрішніх сигналів моделі.

Чому модель ставить посилання, яке не підтверджує твердження?

Маркер цитати - частина генерованого тексту, а не перевірений факт. За бенчмарком ALCE, навіть найкращі моделі на ELI5 не мають повної підтримки цитат у 50% випадків.

Як взагалі дізнатися, що джерело реально вплинуло?

Через атрибуцію за внутрішніми станами моделі. Метод MIRAGE пов’язує токени відповіді з документами, що дійсно вплинули на передбачення, минаючи ненадійні self-citation моделі.

Що робить сторінку «поглинаною»?

Відповідна довжина, чітка структура, семантична відповідність запиту і наявність вилучуваних доказів: визначень, чисел, порівнянь або покрокових пояснень.

Як ми перевіряли матеріал

Автор

Редакція Enigma.

Опубліковано

18 травня 2026.

Оновлено

19 травня 2026.

Джерела

peer-reviewed, препринти та industry research - тип указано поряд із кожним твердженням.

Звірка

ключові тези звірені з актуальною документацією Google Search Central (травень 2026).

Застереження

препринти та галузеві звіти наведені з методологічними обмеженнями; перевіряйте висновки на своєму проєкті.

Повний перелік джерел і рівні надійності - у каталозі досліджень.

Джерела (E-E-A-T)

07 · Zhang, He, Yao, 2026

From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms. https://arxiv.org/abs/2604.25707 - препринт.

32 · Gao, Yen, Yu, Chen, 2023

Enabling Large Language Models to Generate Text with Citations. https://aclanthology.org/2023.emnlp-main.398/ - рецензована (EMNLP).

39 · Wallat et al., 2024/2025

Correctness is not Faithfulness in RAG Attributions. https://dl.acm.org/doi/10.1145/3731120.3744592 - рецензована (ACM DL).

40 · Qi et al., 2024

Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation. https://aclanthology.org/2024.emnlp-main.347/ - рецензована (EMNLP).