nota inżynierska / Weryfikowalne systemy AI

Crash test retrievalu: gdy podobny znaczy niewłaściwy

Dlaczego top-k nie zastępuje benchmarku procesu

Wysokie podobieństwo semantyczne może zwrócić dokument zły czasowo, proceduralnie lub podmiotowo.

W skrócie

  • Negatywne przykłady są częścią datasetu.
  • Metryka retrievalu musi odpowiadać decyzji użytkownika.
  • Cytat należy sprawdzić po pobraniu.

Top-k nie jest wynikiem produktu

Ranking podobieństwa mówi, które wektory znalazły się blisko zapytania. Nie mówi, czy dokument dotyczy właściwego podmiotu, stanu prawnego, etapu procedury ani pytania użytkownika.

Dlatego recall i precision trzeba powiązać z decyzją, którą ma wesprzeć system. Ten sam ranking może być wystarczający do eksploracji i niedopuszczalny do przygotowania uzasadnienia.

Dataset z przypadkami negatywnymi

Zbiór testowy powinien zawierać dokumenty pozornie podobne, lecz niewłaściwe z jednego konkretnego powodu:

  • nieaktualna wersja;
  • inna jurysdykcja;
  • podobne nazwisko lub nazwa podmiotu;
  • inny etap procedury;
  • cytat bez kontekstu zmieniający sens.

Jednostka oceny

Ocena fragmentu nie wystarczy, jeżeli użytkownik potrzebuje całego dokumentu, metadanych i relacji z innymi źródłami. Jednostka retrievalu oraz jednostka oceny muszą odpowiadać końcowemu artefaktowi.

Weryfikacja po pobraniu

Po retrievalu potrzebna jest kontrola cytatu: zgodność tekstu, zakres, źródło, wersja i relacja z twierdzeniem. Model nie powinien sam potwierdzać materiału, który wcześniej wygenerował.

Jak czytać benchmark

Wynik bez opisu korpusu, zapytań, ground truth i tolerowanego błędu jest tylko liczbą. Nie istnieje uniwersalny ranking baz wektorowych; istnieją lepiej lub gorzej zdefiniowane testy konkretnej pracy.

01 / METHOD

Pytanie, które test powinien rozstrzygnąć

Podobny wynik może być zły czasowo, proceduralnie albo podmiotowo; dlatego jednostką oceny nie jest sam wektor, lecz decyzja użytkownika i artefakt, który ma z niej powstać. Wartość publikacji polega na tym, że czytelnik może odróżnić pytanie użytkownika od wygodnej metryki narzędzia i wskazać moment, w którym wynik przestaje być wystarczający do dalszej pracy.

02 / METHOD

Materiał i kontrprzykłady

Zestaw negatywny powinien zawierać dokumenty pozornie trafne: inną jurysdykcję, wersję nieobowiązującą, podobną nazwę podmiotu, inny etap procedury i cytat bez kontekstu. Materiał kontrolny nie ma potwierdzać tezy autora; jego zadaniem jest ujawnić przypadek, w którym prawdopodobny wynik jest niebezpiecznie mylący dla danego workflow.

03 / METHOD

Metoda kontroli

Protokół łączy retrieval, reranking, kontrolę metadanych i citation fidelity. Metryki takie jak Recall@k mają sens wyłącznie wtedy, gdy istnieje rzeczywisty zestaw truth i opisana jednostka zadania. Opis obejmuje kolejność kroków, wejście i ślad wyniku, aby niezależna osoba mogła sprawdzić, co zostało zmierzone oraz czego procedura w ogóle nie mierzy.

04 / METHOD

Macierz akceptacji

Macierz akceptacji określa, który błąd jest tolerowany w eksploracji, a który blokuje użycie wyniku w przygotowaniu materiału zawodowego. Kryteria są jawne przed odczytaniem rezultatu, dzięki czemu pojedynczy udany przykład nie może zastąpić kontroli nad krytycznym typem błędu.

05 / METHOD

Przekazanie i ponowny test

Po zmianie korpusu, modelu embeddingów lub filtra test uruchamia się ponownie z tą samą wersją przypadków i zapisem rozbieżności. Reprodukowalność obejmuje też możliwość pokazania, dlaczego następne uruchomienie różni się od poprzedniego i kto podejmuje decyzję o użyciu nowej wersji.

06 / METHOD

Granice wniosku

Przykład syntetyczny jest oznaczony jako syntetyczny i nie udaje publicznego benchmarku. Tekst nie deklaruje konkretnego wyniku modelu bez źródłowego zestawu danych. Z tego powodu materiał ma charakter metodyczny i nie udaje uniwersalnej recepty ani niezależnego potwierdzenia, którego nie przeprowadzono.

07 / METHOD

Przykład kontroli

Przykład kontrolny może celowo zawierać dwa podobne fragmenty: jeden z właściwej wersji źródła i drugi z błędną jurysdykcją albo datą. Jeśli wynik nie pozwala odróżnić ich przez cytat oraz wersję, podobieństwo nie jest jeszcze dowodem poprawnego retrievalu. Przykład jest syntetyczny, nie wynikiem pomiaru produkcyjnego.

08 / METHOD

Zapis źródła i review

W pakiecie review zapisuje się identyfikator zapytania, wersję korpusu, konfigurację retrievalu, oczekiwany fragment, faktycznie zwrócony fragment i decyzję człowieka. Recall@k ma sens wyłącznie wtedy, gdy taki oznaczony zestaw istnieje; bez niego nie należy przedstawiać liczby jako miary jakości.

09 / METHOD

Szczegół odtworzenia

Po zmianie embeddingów nie wystarczy porównać średniego podobieństwa. Uruchom ten sam oznaczony zestaw negatywny, zapisz identyfikator korpusu i filtrów oraz sprawdź, czy prawidłowy fragment nadal wygrywa z dokumentem o podobnym języku, lecz niewłaściwej dacie lub jurysdykcji. Różnicę w rankingu traktuj jako materiał do review, dopóki nie wyjaśni jej wersja danych albo zmiana reguły.

LIM

Ograniczenia i zakres

Wynik benchmarku zależy od domeny, korpusu i jednostki oceny; nie istnieje uniwersalny ranking baz wektorowych.

SRC

Źródła i wersja zewnętrzna

Oryginalny lub wcześniejszy materiał na Medium

Narzędzia AI wspierały przygotowanie struktury i redakcję. Ostateczna wersja przeszła human editorial review faktów, źródeł, wniosków i przypisania autorstwa.

LOG

Historia zmian

  1. Pierwsza rozszerzona wersja we własnym archiwum.
  2. Przegląd struktury, ograniczeń i powiązań dowodowych.