Багато retrieval-систем працюють із пасажами/чанками. Цей чек-лист - редакційні евристики, виведені з retrieval-досліджень, а не гарантія цитування.
Текст, написаний як суцільна проза, гірше вилучається фрагментами. Ключова теза в середині довгого блоку може не вплинути на відповідь. «Passage-ready» - це інженерія структури, а не копірайтинг заради краси; і не вимога Google дробити контент.
ColBERT запропонував ефективний пошук пасажів через contextualized late interaction - система обирає короткі фрагменти, а не цілі сторінки [27]. Багато retrieval-систем працюють саме з пасажами/чанками, хоча різні продукти можуть також fetch-ити сторінку чи використовувати snippets. Блок має бути зрозумілим окремо від решти сторінки.
DPR показав, що dense-представлення можуть outperform sparse retrieval на open-domain QA задачах [26]; у production часто застосовують гібридні методи. Для passage-ready це означає: вирішують ясні визначення, контекст і повнота, а не щільність ключових слів.
Liu et al. показали, що продуктивність моделей часто вища, коли релевантна інформація на початку/в кінці, і падає в середині довгого контексту [35]. Звідси редакційна евристика (не доведений фактор citation/inclusion): ставити тезу в перше речення блоку, щоб зменшити ризик втрати сенсу.
Менший ризик втрати в довгому контексті [35].
Фрагмент вилучається без контексту сторінки [27].
Семантичний retrieval цінує повноту [26].
Суть не повинна тонути в середині [35].
Зрозумілий окремо від решти сторінки [27].
Адаптація під генеративні рушії вже досліджується. Wu et al. пропонують AutoGEO - фреймворк, що вивчає переваги генеративної пошукової системи й автоматично переписує веб-контент, щоб він краще використовувався у відповідях [3]. Корисна структурна адаптація - так; маніпулятивне «накручування» - ризик.
Salemi et al. розглядають пошук не лише для людей, а й для машинних споживачів, включно з RAG-системами [17]. Passage-ready структура - це й проєктування контенту так, щоб він був легко вилучуваним і придатним для машинного використання, а не лише читабельним для людини.
ColBERT: пошук на рівні пасажів. arxiv.org/abs/2004.12832
Інформація в середині контексту використовується гірше. aclanthology.org/2024.tacl-1.9/
DPR: dense retrieval > збіг ключів на open-domain QA.
AutoGEO: автоматичне переписування під генеративний рушій.
Пошук для машинних споживачів і RAG. arxiv.org/abs/2405.00175
Блок, який вилучається й розуміється окремо від решти сторінки: одна завершена думка, теза на початку, ясне визначення й доказ [27].
Ні. Це редакційні евристики з retrieval-досліджень; вони знижують ризик втрати сенсу, але не гарантують inclusion [35].
Ні. Сучасний retrieval часто семантичний/гібридний: важать ясні визначення, контекст і повнота [26].
Технічно так - AutoGEO це досліджує [3]. Але корисна структурна адаптація відрізняється від маніпуляції; патерни накручування ризикують класифікуватися платформами.