Посилання під відповіддю ChatGPT або Perplexity - це не доказ того, що ваш текст сформував відповідь. Ця стаття показує, де проходить межа між «нас процитували» і «нас справді використали».
Маркетологи і контент-команди міряють успіх в AI-пошуку за одним числом - скільки разів домен потрапив у список цитат. Проблема в тому, що це число майже нічого не говорить про реальний внесок сторінки. Конкретний біль:
Сторінка в списку джерел, але в тексті відповіді - нуль ваших формулювань і фактів.
Бюджет на контент оптимізується під «потрапляння в цитати», а не під вплив на відповідь.
Неможливо пояснити керівництву, чому зростання цитувань не рухає впізнаваність.
Цитата в AI-відповіді - це не один процес, а ланцюг із трьох окремих, але пов’язаних подій. Успіх на одному етапі не гарантує успіху на наступному.
Теза: вибір джерела - це рішення retrieval/ranking pipeline платформи, а не пряме свідчення корисності джерела. Аргумент: модель спочатку запускає пошук і відбирає сторінки за семантичною близькістю до запиту, і лише потім вирішує, що з ними робити. Доказ: у роботі From Citation Selection to Citation Absorption (Zhang, He, Yao, 2026, препринт) selection прямо визначається як етап, на якому «платформа запускає пошук і обирає джерела», окремо від того, чи потрапить джерело у відповідь [7].
Теза: пристебнуте до речення посилання - це заява моделі, а не перевірений факт. Аргумент: у багатьох cited-generation або RAG-системах маркер цитати є частиною згенерованого або постобробленого output; тому він може не підтверджувати конкретне твердження. Доказ: у бенчмарку ALCE (Gao, Yen, Yu, Chen, 2023, рецензована стаття, EMNLP) показано, що на датасеті ELI5 навіть найкращі моделі не мають повної підтримки цитат у 50% випадків - половина «посилань» не підкріплює заявлене [32].
На датасеті ELI5 навіть найкращі моделі не мають повної підтримки цитат у 50% випадків - половина посилань не підкріплює заявлене [32].
Теза: вплив - це коли сторінка віддала у відповідь мову, факти, структуру або докази. Аргумент: ймовірну абсорбцію оцінюють не за наявністю посилання, а за внеском джерела в підсумковий текст. Доказ: той самий препринт Zhang et al. визначає absorption як ситуацію, коли «цитована сторінка вносить мову, докази, структуру або фактичну підтримку у фінальну відповідь», і це окрема метрика від факту цитування [7].
Важливо: пряме вимірювання absorption вимагає доступу до внутрішніх сигналів моделі (як у MIRAGE-підході), що недоступно для закритих платформ; зовнішні інструменти оцінюють ймовірну absorption опосередковано - за збігом мови, фактів і структури відповіді з джерелом, а не як гарантоване знання внутрішнього механізму.
Теза: платформа може цитувати широко, але вбирати вузько. Аргумент: різні рушії по-різному балансують охоплення і глибину цитування. Доказ: у дослідженні Zhang et al. на 602 контрольованих промптах і 21 143 цитатах за трьома платформами Perplexity і Google AI Overview цитують більше джерел у середньому, тоді як ChatGPT цитує менше, але показує «суттєво вищий середній вплив цитат серед видобутих сторінок» [7].
Теза: правильна цитата ≠ чесна цитата. Аргумент: посилання може вести на джерело, яке справді містить факт, але при цьому модель дійшла до відповіді не з нього. Це різниця correctness vs. faithfulness, на якій наполягає робота Correctness is not Faithfulness in RAG Attributions (Wallat et al., 2024/2025, рецензована, ACM Digital Library): коректність атрибуції не дорівнює тому, що джерело реально використовувалося при генерації [39]. Примітка: повний текст цього джерела був недоступний на момент написання; тут відтворюється лише заявлена в заголовку концептуальна різниця, без числових даних.
Теза: щоб дізнатися реальний вплив, потрібно дивитися всередину моделі, а не на її посилання. Аргумент: атрибуція за внутрішніми станами відв’язується від того, що модель «вирішила» процитувати. Доказ: метод MIRAGE (Qi et al., 2024, рецензована, EMNLP) визначає токени відповіді, чутливі до контексту, і пов’язує їх з документами, що реально вплинули на передбачення через saliency-методи - тому що self-citation «не відображає достовірно використання контексту моделлю» [40].
Теза: вбираються не «оптимізовані», а видобувні сторінки. Аргумент: моделі тягнуть у відповідь конкретні одиниці змісту, а не загальну релевантність. Доказ: Zhang et al. (препринт) виділяють у високовпливових сторінок набір ознак - велика довжина, чітка структура, семантична відповідність запиту і насиченість видобувними доказами: визначеннями, числовими фактами, порівняннями, покроковими процедурами [7].
Ретривер відібрав сторінку - потрапляння в список джерел - Джерело 7 (препринт).
Модель пристебнула маркер до фрази - precision/recall цитат, підтримка твердження - Джерело 32 (EMNLP), Джерело 39 (ACM).
Текст відповіді сформований сторінкою - внесок мови/фактів/структури; внутрішня saliency - Джерело 7 (препринт), Джерело 40 (EMNLP).
From Citation Selection to Citation Absorption - препринт (arXiv) - вводить різницю selection vs. absorption; 602 промпти, 21 143 цитати, 3 платформи [7].
Enabling LLMs to Generate Text with Citations - рецензована (EMNLP) - бенчмарк ALCE; на ELI5 немає повної підтримки цитат у 50% випадків [32].
Correctness is not Faithfulness in RAG Attributions - рецензована (ACM DL) - різниця correctness vs. faithfulness атрибуції (повний текст недоступний) [39].
Model Internals-based Answer Attribution / MIRAGE - рецензована (EMNLP) - атрибуція за внутрішніми станами моделі замість self-citation [40].
Ні. Це citation selection - ретривер відібрав сторінку. Вплив (absorption) - окрема подія, за якої текст сторінки реально потрапив у відповідь. Ймовірну absorption можна оцінити лише опосередковано без доступу до внутрішніх сигналів моделі.
Маркер цитати - частина генерованого тексту, а не перевірений факт. За бенчмарком ALCE, навіть найкращі моделі на ELI5 не мають повної підтримки цитат у 50% випадків.
Через атрибуцію за внутрішніми станами моделі. Метод MIRAGE пов’язує токени відповіді з документами, що дійсно вплинули на передбачення, минаючи ненадійні self-citation моделі.
Відповідна довжина, чітка структура, семантична відповідність запиту і наявність вилучуваних доказів: визначень, чисел, порівнянь або покрокових пояснень.
Редакція Enigma.
18 травня 2026.
19 травня 2026.
peer-reviewed, препринти та industry research - тип указано поряд із кожним твердженням.
ключові тези звірені з актуальною документацією Google Search Central (травень 2026).
препринти та галузеві звіти наведені з методологічними обмеженнями; перевіряйте висновки на своєму проєкті.
Повний перелік джерел і рівні надійності - у каталозі досліджень.
From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms. https://arxiv.org/abs/2604.25707 - препринт.
Enabling Large Language Models to Generate Text with Citations. https://aclanthology.org/2023.emnlp-main.398/ - рецензована (EMNLP).
Correctness is not Faithfulness in RAG Attributions. https://dl.acm.org/doi/10.1145/3731120.3744592 - рецензована (ACM DL).
Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation. https://aclanthology.org/2024.emnlp-main.347/ - рецензована (EMNLP).