инженерная заметка / Проверяемые AI-системы

Краш-тест поиска: когда похожее означает неверное

Почему top-k не заменяет проверку рабочего процесса

Высокое семантическое сходство может вернуть документ, не соответствующий нужному периоду, процедуре или субъекту права.

Кратко

  • Негативные примеры должны входить в набор данных.
  • Метрики поиска должны соответствовать решению пользователя.
  • После поиска цитату необходимо проверить.

Top-k — не продуктовый результат

Ранжирование по сходству показывает, какие векторы близки к запросу. Оно не отвечает, относится ли документ к нужной стороне, применимому праву, процессуальной стадии или вопросу пользователя.

Поэтому полноту и точность поиска необходимо связывать с решением, которое поддерживает система. Один и тот же рейтинг может быть приемлем для разведочного поиска и неприемлем для подготовки обоснования.

Набор данных с негативными примерами

Тестовый набор должен включать документы, которые выглядят релевантными, но не подходят по одной конкретной причине:

  • устаревшая версия;
  • другая юрисдикция;
  • похожее имя человека или организации;
  • иная процессуальная стадия;
  • цитата, смысл которой меняется из-за отсутствующего контекста.

Единица оценки

Оценки на уровне фрагмента недостаточно, если пользователю нужен целый документ, метаданные и связи с другими источниками. Единица поиска и единица оценки должны соответствовать итоговому артефакту.

Проверка после поиска

После поиска следует проверять цитату: точный текст, охват, источник, версию и связь с утверждением. Модель не должна быть единственным проверяющим материала, который она ранее сформировала.

Как читать результат теста

Оценка без корпуса, набора запросов, эталона и допустимой ошибки — лишь число. Универсального рейтинга векторных баз данных не существует; существуют лучше или хуже заданные проверки конкретной задачи.

01 / METHOD

Какой вопрос должен решить тест

Похожий результат может быть неверным по времени, процедуре или субъекту; поэтому единицей оценки служит не сам вектор, а решение пользователя и артефакт, который оно должно поддержать. Ценность материала в том, что читатель может отделить вопрос пользователя от удобной метрики инструмента и назвать момент, когда результата уже недостаточно для дальнейшей работы.

02 / METHOD

Материал и контрпримеры

Негативный набор должен содержать внешне релевантные документы: другую юрисдикцию, неактуальную версию, похожее имя субъекта, другой этап процедуры и цитату без контекста. Контрольный материал не должен подтверждать тезис автора: его задача — выявить случай, где правдоподобный результат опасно вводит в заблуждение для данного процесса.

03 / METHOD

Метод контроля

Протокол связывает поиск, reranking, проверку метаданных и точность цитирования. Метрики вроде Recall@k осмысленны только при наличии реального truth set и описанной единицы задачи. Описание включает порядок шагов, вход и след результата, чтобы независимый человек мог проверить, что измерялось и чего процедура вообще не измеряет.

04 / METHOD

Матрица приёмки

Матрица приёмки указывает, какая ошибка допустима для исследования, а какая блокирует использование результата при подготовке профессионального материала. Критерии заданы до чтения результата, поэтому один удачный пример не может заменить контроль критического типа ошибки.

05 / METHOD

Передача и повторный тест

После изменения корпуса, модели эмбеддингов или фильтра тест запускается заново на той же обозначенной группе случаев с записью расхождений. Воспроизводимость включает и возможность показать, почему следующий запуск отличается от предыдущего и кто принимает решение использовать новую версию.

06 / METHOD

Границы вывода

Любой синтетический пример помечен как синтетический и не выдаётся за публичный benchmark. Статья не заявляет результат модели без набора данных с источником. Поэтому материал имеет методический характер и не выдаёт себя за универсальный рецепт или независимое подтверждение, которого не проводилось.

07 / METHOD

Пример контроля

Контрольный пример может намеренно содержать два похожих фрагмента: один из правильной версии источника, второй — с неверной юрисдикцией или датой. Если результат нельзя различить по цитате и версии, сходство ещё не доказывает корректность поиска. Это синтетический пример, а не измерение production-системы.

08 / METHOD

Запись об источнике и review

В пакете review фиксируются идентификатор запроса, версия корпуса, конфигурация поиска, ожидаемый фрагмент, фактически возвращённый фрагмент и решение человека. Recall@k имеет смысл только при наличии такого размеченного набора; без него число нельзя выдавать за показатель качества.

09 / METHOD

Деталь воспроизведения

После смены эмбеддингов недостаточно сравнить среднее сходство. Запустите тот же размеченный негативный набор, сохраните идентификатор корпуса и фильтров и проверьте, побеждает ли правильный фрагмент документ с похожим языком, но неверной датой или юрисдикцией. Разницу в ранжировании следует передать на review, пока её не объяснит версия данных или изменение правила.

LIM

Ограничения и область применения

Результаты тестирования зависят от предметной области, корпуса и единицы оценки; универсального рейтинга векторных баз данных не существует.

SRC

Источники и внешняя версия

Оригинальный или более ранний материал на Medium

Инструменты AI использовались для структуры и редактирования. Окончательная версия прошла human editorial review фактов, источников, выводов и атрибуции.

LOG

История изменений

  1. Первая расширенная версия в собственном архиве.
  2. Проверка структуры, ограничений и доказательных связей.