← GEO Playbook·GEO Playbook · Раздел 03

Passage retrieval: почему блоки страницы должны быть самодостаточными

Во многих retrieval/RAG-сценариях система извлекает не всю страницу, а короткие пассажи. Поэтому каждый блок должен отвечать на один вопрос без скрытого контекста.

7 мин чтения

Passage-ready контент - это не «текст для роботов», а ясная структура для людей и машинных потребителей. Если ключевой тезис спрятан в середине длинного абзаца, retrieval-система может извлечь фрагмент без нужного контекста, а модель не использует его в ответе.

Семантика важнее плотности ключей

Dense Passage Retrieval показал, что плотные представления могут превосходить sparse retrieval в open-domain QA [26]. Практический вывод: абзац должен ясно раскрывать сущность, сценарий и ограничение, а не просто повторять ключевое слово.

Извлекается фрагмент, а не вся страница

ColBERT описывает эффективный поиск на уровне пассажей через contextualized late interaction [27]. Это не означает, что Google требует дробить страницу; это означает, что самостоятельный H2/H3-блок легче использовать в retrieval-сценариях и проще цитировать без потери смысла.

Lost in the middle

Liu et al. показали: модели лучше используют информацию в начале или конце длинного контекста и хуже - в середине [35]. Поэтому тезис должен стоять в первом предложении блока, а доказательство - рядом, в том же фрагменте.

Один блок - один ответ

Не смешивайте определение, пример и исключение в длинную простыню: retrieval может забрать только часть.

Тезис в начале

Снижает риск, что смысл потеряется в длинном контексте [35].

Доказательство рядом

Факт, дата, источник или пример должны находиться в том же блоке, что и утверждение.

Границы применения

Укажите, когда вывод работает, а когда это только эвристика, чтобы не создавать overclaim.

Активный retrieval во время ответа

FLARE описывает класс active-retrieval архитектур, где модель может доизвлекать информацию во время генерации [47]. Это не правило для каждого продукта, но оно усиливает редакционный вывод: блок должен быть понятен и при первичном поиске, и при уточняющем запросе.

Частые вопросы

Что такое passage retrieval?

Это извлечение короткого релевантного фрагмента документа вместо обработки всей страницы целиком или до неё; разные продукты могут сочетать пассажи, сниппеты и full-page fetch [27].

Нужно ли искусственно дробить страницу?

Нет. Google не требует chunking. Самодостаточные блоки нужны для ясности, цитируемости и машинного извлечения, а не для обхода алгоритмов.

Как сделать блок passage-ready?

Начните с прямого тезиса, добавьте аргумент, доказательство и ограничение. Один блок должен отвечать на один конкретный intent.

Ключевые слова всё ещё важны?

Да, но как часть семантики. Dense retrieval ценит смысловую близость и полноту ответа, а не механическую плотность ключей [26].

Источники (E-E-A-T)

26 · Karpukhin et al., 2020, EMNLP

Dense Passage Retrieval for Open-Domain Question Answering. https://aclanthology.org/2020.emnlp-main.550/

27 · Khattab and Zaharia, 2020, SIGIR

ColBERT: Efficient and Effective Passage Search. https://arxiv.org/abs/2004.12832

35 · Liu et al., 2024, TACL

Lost in the Middle: How Language Models Use Long Contexts. https://aclanthology.org/2024.tacl-1.9/

47 · Jiang et al., 2023, EMNLP

FLARE: Forward-Looking Active Retrieval Augmented Generation. https://aclanthology.org/2023.emnlp-main.495/