← GEO Playbook·GEO Playbook · Розділ 03

Passage retrieval: чому блоки сторінки мають бути самодостатніми

Багато retrieval-систем працюють із пасажами/чанками, а не сторінкою цілком. Це змінює те, як треба будувати кожен блок контенту.

7 хв читання

Багато retrieval-систем оперують пасажами/чанками - довга «розгінна» структура шкодить. Ключова думка, схована в середині тексту, може не вплинути на відповідь. Один блок без контексту сторінки має бути зрозумілим сам по собі.

Семантика, а не ключові слова

Сучасний retrieval часто працює з векторною (семантичною) близькістю, а не лише збігом слів. Dense Passage Retrieval показав, що dense-представлення можуть outperform sparse retrieval на open-domain QA задачах [26]; у production-пошуку часто застосовують гібридні (dense + sparse) методи. Для GEO це означає: важливі ясні визначення, контекст і повнота відповіді, а не лише щільність ключових слів.

Часто вилучається фрагмент, а не сторінка цілком

ColBERT запропонував ефективний пошук пасажів через contextualized late interaction - система обирає короткі фрагменти, а не цілі сторінки [27]. Багато retrieval-систем працюють саме з пасажами/чанками, хоча різні продукти можуть також fetch-ити сторінку, використовувати snippets або search results. Практичний наслідок: кожен блок H2/H3 краще робити самодостатнім пасажем, зрозумілим навіть окремо від решти сторінки.

«Загублений у середині»

Навіть потрапивши в контекст, інформація може не спрацювати. Liu et al. показали, що продуктивність моделей часто вища, коли релевантна інформація на початку/в кінці, і падає, коли вона в середині довгого контексту [35]. Практичний наслідок (редакційна евристика, а не доведений фактор citation/inclusion): ставимо тезу на початку блоку, щоб зменшити ризик втрати сенсу в довгому контексті.

Довга підводка перед суттю

Антипатерн: суть тоне в середині контексту [35]. Патерн GEO: теза в першому реченні блоку.

Думка розкидана по сторінці

Антипатерн: фрагмент вилучається без контексту [27]. Патерн GEO: один блок = одна завершена відповідь.

Ставка на щільність ключів

Антипатерн: retrieval часто семантичний/гібридний [26]. Патерн GEO: ясні визначення й повнота.

Контент шукають і під час відповіді

Retrieval - не завжди одноразова дія на старті. FLARE описує клас active-retrieval архітектур, де модель сама вирішує, коли дошукати інформацію в процесі генерації [47]; це можливий клас систем, а не правило для кожного продукту. Тож у таких системах добре структурований блок може бути вилучений і під час уточнення складного запиту.

Якість корпусу важить

Доступність і якість представлення контенту мають значення на рівні корпусу. RETRO показав, що retrieval із великого корпусу може покращувати генерацію моделі [49]; для GEO це непрямо обґрунтовує увагу до доступності й якості представлення контенту, але не гарантує видимість у конкретному answer engine.

Джерела (E-E-A-T)

26 · Karpukhin et al., 2020, EMNLP

DPR: семантичний dense retrieval > збіг ключів на open-domain QA. aclanthology.org/2020.emnlp-main.550/

27 · Khattab & Zaharia, 2020, SIGIR

ColBERT: пошук на рівні пасажів. arxiv.org/abs/2004.12832

35 · Liu et al., 2024, TACL

Інформація в середині контексту використовується гірше. aclanthology.org/2024.tacl-1.9/

47 · Jiang et al., 2023, EMNLP

FLARE: активне вилучення під час генерації. aclanthology.org/2023.emnlp-main.495/

49 · Borgeaud et al., 2022, ICML

RETRO: retrieval із великого корпусу покращує генерацію. arxiv.org/abs/2112.04426

Часті питання

Що таке passage retrieval?

У багатьох retrieval/RAG-системах - це вилучення короткого релевантного фрагмента документа (пасажу) замість або перед обробкою сторінки цілком; різні продукти можуть також використовувати snippets, full-page fetch або SERP-результати [27].

Чому довгий вступ може шкодити видимості?

Бо моделі гірше використовують інформацію в середині довгого контексту [35]. Якщо суть схована за підводкою, вона може не вплинути на відповідь, навіть коли фрагмент вилучено.

Як зробити блок «passage-ready»?

Один блок - одна завершена думка з тезисом у першому реченні, без залежності від решти сторінки, з ясним визначенням і доказом: даними, джерелом, прикладом або коротким поясненням.

Чи допоможуть ключові слова потрапити у відповідь AI?

Самі по собі переважно ні. Сучасний retrieval часто семантичний (нерідко гібридний): вирішують ясність визначень, контекст і повнота, а не лише щільність ключів [26].