Answer engine не «читает весь интернет» в момент ответа - он за доли секунды достаёт несколько фрагментов текста и пересказывает их. Понимание этого механизма напрямую определяет, попадёт ваш контент в ответ или нет.
Вы написали отличную статью, она в топе обычного поиска - но в ответе ChatGPT или AI Overviews её нет. Так происходит, потому что:
Многие retrieval-системы работают с фрагментами (passages), а не только со страницей целиком.
В контекст модели часто попадает не вся страница, а наиболее релевантные фрагменты.
Даже попав в контекст, ваш фрагмент может быть проигнорирован из-за позиции, в которую его поставил retriever.
Чтобы влиять на эти три точки, нужно понимать конвейер RAG. Ниже это описано как ментальная модель работы многих RAG/retrieval-систем - это способ рассуждать о механике, а не универсальное правило и не требование Google Search.
Важный баланс. Google прямо заявляет: искусственное дробление контента на мелкие куски НЕ требуется, а его системы понимают страницу, в которой раскрыто несколько тем; делать блоки самодостаточными и ясными нужно ради людей, а не «только для AI» [85]. То есть модель RAG ниже объясняет механику retrieval-конвейеров, но не диктует, что страницу нужно рвать на части ради алгоритмов.
Раздел ниже - техническая модель RAG: как устроены многие retrieval-конвейеры. Это объяснение механики, а не требования Google Search; механизмы DPR/ColBERT/lost-in-the-middle описывают поведение retrieval-систем, а не предписывают, как форматировать страницу под алгоритмы.
Тезис. Современный answer engine построен на архитектуре RAG (Retrieval-Augmented Generation) - связке внешнего поиска и языковой модели.
Аргумент. Lewis et al. формализовали RAG как комбинацию двух типов памяти: параметрической (предобученная seq2seq-модель, в их работе - BART) и непараметрической (плотный векторный индекс Википедии, доступ к которому даёт нейросетевой retriever - DPR). Модель не «знает» ответ - она достаёт документы и генерирует ответ поверх них.
Доказательство. Авторы показали, что такая связка генерирует «более конкретный, разнообразный и фактологичный язык», чем чисто параметрическая seq2seq-модель того же размера, и установила SOTA на трёх задачах open-domain QA [24].
Lewis et al. описали два режима. RAG-Sequence использует один и тот же набор найденных пассажей на весь ответ. RAG-Token может брать разные пассажи для каждого отдельного токена. Практический вывод для маркетолога: финальный ответ - это монтаж из нескольких источников, а не пересказ одной «лучшей» страницы. Ваша задача - попасть в монтаж.
Тезис. Решающий этап - retrieval. Если фрагмент сюда не попал, дальше ничего не происходит.
Аргумент. Классический поиск по пассажам опирался на разреженные векторы - TF-IDF или BM25, то есть на пересечение слов. Karpukhin et al. показали, что плотный (dense) ретривер на базе dual-encoder - отдельные энкодеры для вопроса и для пассажа - учится семантической близости, а не совпадению слов.
Доказательство. DPR обошёл сильную систему Lucene-BM25 на 9–19% абсолютных по точности top-20 retrieval и установил новый SOTA на нескольких бенчмарках open-domain QA [26].
Dense-ретривер DPR обошёл сильную систему Lucene-BM25 на 9–19% абсолютных по точности top-20 retrieval [26].
Следствие для контента. Дословное вхождение ключевика больше не гарантирует попадание в выдачу answer engine - важна семантическая однозначность абзаца: чтобы один пассаж сам по себе отвечал на один вопрос.
Тезис. Не все dense-ретриверы сжимают документ в один вектор - и это меняет требования к тексту.
Аргумент. ColBERT использует late interaction: запрос и документ кодируются независимо на уровне токенов, а близость считается оператором MaxSim - для каждого токена запроса берётся максимально похожий токен документа. Это сохраняет точечные совпадения смысла, которые одновекторные модели «усредняют» и теряют.
Доказательство. ColBERT достигает эффективности, сопоставимой с BERT-кросс-энкодерами, будучи при этом на два порядка быстрее и требуя на четыре порядка меньше FLOPs на запрос [27].
Следствие. Скорость late interaction - причина, по которой answer engines могут позволить себе глубокий ретрив в реальном времени. Для вас это значит: конкретные термины и сущности в абзаце дают точечные «зацепки» для MaxSim, тогда как размытые формулировки таких зацепок не создают.
Тезис. Попасть в контекст модели - необходимое, но не достаточное условие. Позиция фрагмента в окне контекста влияет на то, использует ли его модель.
Аргумент. Liu et al. обнаружили U-образную кривую: модели лучше всего используют информацию в начале или в конце контекста и значительно хуже - когда нужный факт лежит в середине длинного контекста. Эффект назвали lost in the middle и зафиксировали даже у моделей, специально заявленных как long-context.
Доказательство. Эффект подтверждён на двух типах задач - multi-document QA и key-value retrieval; перестановка позиции релевантного документа значимо меняет качество ответа [35].
Следствие. Вы не контролируете, в какую позицию ретривер поставит ваш пассаж. Единственный рычаг - делать каждый фрагмент самодостаточным, чтобы он работал, даже оказавшись в «слепой» середине.
Тезис. Языковая модель пересказывает попавшие в контекст пассажи и присваивает атрибуцию (ссылку) тем источникам, чьи фрагменты дословно поддержали утверждение.
Аргумент. Поскольку RAG-Token может опираться на разные пассажи для разных частей ответа [24], атрибутируется не «сайт», а конкретный извлекаемый фрагмент. Чем чище маппинг «один абзац → один тезис → один факт», тем выше шанс, что именно ваш фрагмент станет опорным.
Доказательство. Это прямое следствие того, что RAG-модели генерируют более фактологичный язык именно за счёт непараметрической памяти [24] - модели «выгоднее» опереться на чёткий извлечённый пассаж, чем галлюцинировать.
Следствие. Заголовки-вопросы, короткие абзацы-ответы, явные сущности и числа - это не SEO-ритуал, а форма, которую конвейер ретрив→контекст→генерация умеет извлекать и атрибутировать.
Все тезисы выше опираются на рецензируемые публикации (конференции/журнал), не на блог-посты:
Lewis et al., 2020 (NeurIPS) - RAG-Sequence/Token; больше фактологичности vs параметрическая модель; SOTA на 3 open-domain QA - https://arxiv.org/abs/2005.11401 [24].
Karpukhin et al., 2020 (EMNLP) - DPR > BM25 на 9–19% абс. (top-20) - https://aclanthology.org/2020.emnlp-main.550/ [26].
Khattab & Zaharia, 2020 (SIGIR) - MaxSim; ×100 быстрее, ×10000 меньше FLOPs при сопоставимом качестве - https://arxiv.org/abs/2004.12832 [27].
Liu et al., 2024 (TACL) - U-образная кривая, эффект lost-in-the-middle - https://aclanthology.org/2024.tacl-1.9/ [35].
В модели RAG ретривер достаёт отдельные пассажи, и в контекст модели часто попадает не вся страница. При этом Google заявляет, что искусственно дробить контент не требуется - делать блоки самодостаточными нужно ради читателя, а не «только для AI».
Dense-ретриверы (DPR) ищут по смыслу, а не по совпадению слов, и могут предпочесть более семантически однозначный фрагмент конкурента, даже если у вас выше классический ранг.
Это установленный эффект (Liu et al., 2024): модели хуже используют факты, оказавшиеся в середине длинного контекста, чем в начале или конце. Кривая качества U-образная.
Делайте абзацы самодостаточными: один абзац - один тезис - один факт с конкретными сущностями и числами, чтобы фрагмент работал в любой позиции контекста.
Редакция Enigma.
18 мая 2026.
18 мая 2026.
peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением.
ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026).
препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте.
Полный перечень источников и уровни надёжности - в каталоге исследований.
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. https://arxiv.org/abs/2005.11401 - рецензируемая (NeurIPS).
Dense Passage Retrieval for Open-Domain Question Answering. https://aclanthology.org/2020.emnlp-main.550/ - рецензируемая (EMNLP).
ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. https://arxiv.org/abs/2004.12832 - рецензируемая (SIGIR).
Lost in the Middle: How Language Models Use Long Contexts. https://aclanthology.org/2024.tacl-1.9/ - рецензируемая (TACL).
Google's Guide to Optimizing for Generative AI Features on Google Search. https://developers.google.com/search/docs/fundamentals/ai-optimization-guide - офиц. документ.