Багато retrieval-систем працюють із пасажами/чанками, а не сторінкою цілком. Це змінює те, як треба будувати кожен блок контенту.
Багато retrieval-систем оперують пасажами/чанками - довга «розгінна» структура шкодить. Ключова думка, схована в середині тексту, може не вплинути на відповідь. Один блок без контексту сторінки має бути зрозумілим сам по собі.
Сучасний retrieval часто працює з векторною (семантичною) близькістю, а не лише збігом слів. Dense Passage Retrieval показав, що dense-представлення можуть outperform sparse retrieval на open-domain QA задачах [26]; у production-пошуку часто застосовують гібридні (dense + sparse) методи. Для GEO це означає: важливі ясні визначення, контекст і повнота відповіді, а не лише щільність ключових слів.
ColBERT запропонував ефективний пошук пасажів через contextualized late interaction - система обирає короткі фрагменти, а не цілі сторінки [27]. Багато retrieval-систем працюють саме з пасажами/чанками, хоча різні продукти можуть також fetch-ити сторінку, використовувати snippets або search results. Практичний наслідок: кожен блок H2/H3 краще робити самодостатнім пасажем, зрозумілим навіть окремо від решти сторінки.
Навіть потрапивши в контекст, інформація може не спрацювати. Liu et al. показали, що продуктивність моделей часто вища, коли релевантна інформація на початку/в кінці, і падає, коли вона в середині довгого контексту [35]. Практичний наслідок (редакційна евристика, а не доведений фактор citation/inclusion): ставимо тезу на початку блоку, щоб зменшити ризик втрати сенсу в довгому контексті.
Антипатерн: суть тоне в середині контексту [35]. Патерн GEO: теза в першому реченні блоку.
Антипатерн: фрагмент вилучається без контексту [27]. Патерн GEO: один блок = одна завершена відповідь.
Антипатерн: retrieval часто семантичний/гібридний [26]. Патерн GEO: ясні визначення й повнота.
Retrieval - не завжди одноразова дія на старті. FLARE описує клас active-retrieval архітектур, де модель сама вирішує, коли дошукати інформацію в процесі генерації [47]; це можливий клас систем, а не правило для кожного продукту. Тож у таких системах добре структурований блок може бути вилучений і під час уточнення складного запиту.
Доступність і якість представлення контенту мають значення на рівні корпусу. RETRO показав, що retrieval із великого корпусу може покращувати генерацію моделі [49]; для GEO це непрямо обґрунтовує увагу до доступності й якості представлення контенту, але не гарантує видимість у конкретному answer engine.
DPR: семантичний dense retrieval > збіг ключів на open-domain QA. aclanthology.org/2020.emnlp-main.550/
ColBERT: пошук на рівні пасажів. arxiv.org/abs/2004.12832
Інформація в середині контексту використовується гірше. aclanthology.org/2024.tacl-1.9/
FLARE: активне вилучення під час генерації. aclanthology.org/2023.emnlp-main.495/
RETRO: retrieval із великого корпусу покращує генерацію. arxiv.org/abs/2112.04426
У багатьох retrieval/RAG-системах - це вилучення короткого релевантного фрагмента документа (пасажу) замість або перед обробкою сторінки цілком; різні продукти можуть також використовувати snippets, full-page fetch або SERP-результати [27].
Бо моделі гірше використовують інформацію в середині довгого контексту [35]. Якщо суть схована за підводкою, вона може не вплинути на відповідь, навіть коли фрагмент вилучено.
Один блок - одна завершена думка з тезисом у першому реченні, без залежності від решти сторінки, з ясним визначенням і доказом: даними, джерелом, прикладом або коротким поясненням.
Самі по собі переважно ні. Сучасний retrieval часто семантичний (нерідко гібридний): вирішують ясність визначень, контекст і повнота, а не лише щільність ключів [26].