инженерная заметка / Проверяемые AI-системы
Краш-тест поиска: когда похожее означает неверное
Почему top-k не заменяет проверку рабочего процесса
Высокое семантическое сходство может вернуть документ, не соответствующий нужному периоду, процедуре или субъекту права.
Кратко
- Негативные примеры должны входить в набор данных.
- Метрики поиска должны соответствовать решению пользователя.
- После поиска цитату необходимо проверить.
Top-k — не продуктовый результат
Ранжирование по сходству показывает, какие векторы близки к запросу. Оно не отвечает, относится ли документ к нужной стороне, применимому праву, процессуальной стадии или вопросу пользователя.
Поэтому полноту и точность поиска необходимо связывать с решением, которое поддерживает система. Один и тот же рейтинг может быть приемлем для разведочного поиска и неприемлем для подготовки обоснования.
Набор данных с негативными примерами
Тестовый набор должен включать документы, которые выглядят релевантными, но не подходят по одной конкретной причине:
- устаревшая версия;
- другая юрисдикция;
- похожее имя человека или организации;
- иная процессуальная стадия;
- цитата, смысл которой меняется из-за отсутствующего контекста.
Единица оценки
Оценки на уровне фрагмента недостаточно, если пользователю нужен целый документ, метаданные и связи с другими источниками. Единица поиска и единица оценки должны соответствовать итоговому артефакту.
Проверка после поиска
После поиска следует проверять цитату: точный текст, охват, источник, версию и связь с утверждением. Модель не должна быть единственным проверяющим материала, который она ранее сформировала.
Как читать результат теста
Оценка без корпуса, набора запросов, эталона и допустимой ошибки — лишь число. Универсального рейтинга векторных баз данных не существует; существуют лучше или хуже заданные проверки конкретной задачи.
01 / METHOD
Какой вопрос должен решить тест
Похожий результат может быть неверным по времени, процедуре или субъекту; поэтому единицей оценки служит не сам вектор, а решение пользователя и артефакт, который оно должно поддержать. Ценность материала в том, что читатель может отделить вопрос пользователя от удобной метрики инструмента и назвать момент, когда результата уже недостаточно для дальнейшей работы.
02 / METHOD
Материал и контрпримеры
Негативный набор должен содержать внешне релевантные документы: другую юрисдикцию, неактуальную версию, похожее имя субъекта, другой этап процедуры и цитату без контекста. Контрольный материал не должен подтверждать тезис автора: его задача — выявить случай, где правдоподобный результат опасно вводит в заблуждение для данного процесса.
03 / METHOD
Метод контроля
Протокол связывает поиск, reranking, проверку метаданных и точность цитирования. Метрики вроде Recall@k осмысленны только при наличии реального truth set и описанной единицы задачи. Описание включает порядок шагов, вход и след результата, чтобы независимый человек мог проверить, что измерялось и чего процедура вообще не измеряет.
04 / METHOD
Матрица приёмки
Матрица приёмки указывает, какая ошибка допустима для исследования, а какая блокирует использование результата при подготовке профессионального материала. Критерии заданы до чтения результата, поэтому один удачный пример не может заменить контроль критического типа ошибки.
05 / METHOD
Передача и повторный тест
После изменения корпуса, модели эмбеддингов или фильтра тест запускается заново на той же обозначенной группе случаев с записью расхождений. Воспроизводимость включает и возможность показать, почему следующий запуск отличается от предыдущего и кто принимает решение использовать новую версию.
06 / METHOD
Границы вывода
Любой синтетический пример помечен как синтетический и не выдаётся за публичный benchmark. Статья не заявляет результат модели без набора данных с источником. Поэтому материал имеет методический характер и не выдаёт себя за универсальный рецепт или независимое подтверждение, которого не проводилось.
07 / METHOD
Пример контроля
Контрольный пример может намеренно содержать два похожих фрагмента: один из правильной версии источника, второй — с неверной юрисдикцией или датой. Если результат нельзя различить по цитате и версии, сходство ещё не доказывает корректность поиска. Это синтетический пример, а не измерение production-системы.
08 / METHOD
Запись об источнике и review
В пакете review фиксируются идентификатор запроса, версия корпуса, конфигурация поиска, ожидаемый фрагмент, фактически возвращённый фрагмент и решение человека. Recall@k имеет смысл только при наличии такого размеченного набора; без него число нельзя выдавать за показатель качества.
09 / METHOD
Деталь воспроизведения
После смены эмбеддингов недостаточно сравнить среднее сходство. Запустите тот же размеченный негативный набор, сохраните идентификатор корпуса и фильтров и проверьте, побеждает ли правильный фрагмент документ с похожим языком, но неверной датой или юрисдикцией. Разницу в ранжировании следует передать на review, пока её не объяснит версия данных или изменение правила.
LIM
Ограничения и область применения
Результаты тестирования зависят от предметной области, корпуса и единицы оценки; универсального рейтинга векторных баз данных не существует.
SRC
Источники и внешняя версия
Оригинальный или более ранний материал на Medium
Инструменты AI использовались для структуры и редактирования. Окончательная версия прошла human editorial review фактов, источников, выводов и атрибуции.
LOG
История изменений
- Первая расширенная версия в собственном архиве.
- Проверка структуры, ограничений и доказательных связей.