Во многих retrieval/RAG-сценариях система извлекает не всю страницу, а короткие пассажи. Поэтому каждый блок должен отвечать на один вопрос без скрытого контекста.
Passage-ready контент - это не «текст для роботов», а ясная структура для людей и машинных потребителей. Если ключевой тезис спрятан в середине длинного абзаца, retrieval-система может извлечь фрагмент без нужного контекста, а модель не использует его в ответе.
Dense Passage Retrieval показал, что плотные представления могут превосходить sparse retrieval в open-domain QA [26]. Практический вывод: абзац должен ясно раскрывать сущность, сценарий и ограничение, а не просто повторять ключевое слово.
ColBERT описывает эффективный поиск на уровне пассажей через contextualized late interaction [27]. Это не означает, что Google требует дробить страницу; это означает, что самостоятельный H2/H3-блок легче использовать в retrieval-сценариях и проще цитировать без потери смысла.
Liu et al. показали: модели лучше используют информацию в начале или конце длинного контекста и хуже - в середине [35]. Поэтому тезис должен стоять в первом предложении блока, а доказательство - рядом, в том же фрагменте.
Не смешивайте определение, пример и исключение в длинную простыню: retrieval может забрать только часть.
Снижает риск, что смысл потеряется в длинном контексте [35].
Факт, дата, источник или пример должны находиться в том же блоке, что и утверждение.
Укажите, когда вывод работает, а когда это только эвристика, чтобы не создавать overclaim.
FLARE описывает класс active-retrieval архитектур, где модель может доизвлекать информацию во время генерации [47]. Это не правило для каждого продукта, но оно усиливает редакционный вывод: блок должен быть понятен и при первичном поиске, и при уточняющем запросе.
Это извлечение короткого релевантного фрагмента документа вместо обработки всей страницы целиком или до неё; разные продукты могут сочетать пассажи, сниппеты и full-page fetch [27].
Нет. Google не требует chunking. Самодостаточные блоки нужны для ясности, цитируемости и машинного извлечения, а не для обхода алгоритмов.
Начните с прямого тезиса, добавьте аргумент, доказательство и ограничение. Один блок должен отвечать на один конкретный intent.
Да, но как часть семантики. Dense retrieval ценит смысловую близость и полноту ответа, а не механическую плотность ключей [26].
Dense Passage Retrieval for Open-Domain Question Answering. https://aclanthology.org/2020.emnlp-main.550/
ColBERT: Efficient and Effective Passage Search. https://arxiv.org/abs/2004.12832
Lost in the Middle: How Language Models Use Long Contexts. https://aclanthology.org/2024.tacl-1.9/
FLARE: Forward-Looking Active Retrieval Augmented Generation. https://aclanthology.org/2023.emnlp-main.495/