nota inżynierska / Weryfikowalne systemy AI
Crash test retrievalu: gdy podobny znaczy niewłaściwy
Dlaczego top-k nie zastępuje benchmarku procesu
Wysokie podobieństwo semantyczne może zwrócić dokument zły czasowo, proceduralnie lub podmiotowo.
W skrócie
- Negatywne przykłady są częścią datasetu.
- Metryka retrievalu musi odpowiadać decyzji użytkownika.
- Cytat należy sprawdzić po pobraniu.
Top-k nie jest wynikiem produktu
Ranking podobieństwa mówi, które wektory znalazły się blisko zapytania. Nie mówi, czy dokument dotyczy właściwego podmiotu, stanu prawnego, etapu procedury ani pytania użytkownika.
Dlatego recall i precision trzeba powiązać z decyzją, którą ma wesprzeć system. Ten sam ranking może być wystarczający do eksploracji i niedopuszczalny do przygotowania uzasadnienia.
Dataset z przypadkami negatywnymi
Zbiór testowy powinien zawierać dokumenty pozornie podobne, lecz niewłaściwe z jednego konkretnego powodu:
- nieaktualna wersja;
- inna jurysdykcja;
- podobne nazwisko lub nazwa podmiotu;
- inny etap procedury;
- cytat bez kontekstu zmieniający sens.
Jednostka oceny
Ocena fragmentu nie wystarczy, jeżeli użytkownik potrzebuje całego dokumentu, metadanych i relacji z innymi źródłami. Jednostka retrievalu oraz jednostka oceny muszą odpowiadać końcowemu artefaktowi.
Weryfikacja po pobraniu
Po retrievalu potrzebna jest kontrola cytatu: zgodność tekstu, zakres, źródło, wersja i relacja z twierdzeniem. Model nie powinien sam potwierdzać materiału, który wcześniej wygenerował.
Jak czytać benchmark
Wynik bez opisu korpusu, zapytań, ground truth i tolerowanego błędu jest tylko liczbą. Nie istnieje uniwersalny ranking baz wektorowych; istnieją lepiej lub gorzej zdefiniowane testy konkretnej pracy.
01 / METHOD
Pytanie, które test powinien rozstrzygnąć
Podobny wynik może być zły czasowo, proceduralnie albo podmiotowo; dlatego jednostką oceny nie jest sam wektor, lecz decyzja użytkownika i artefakt, który ma z niej powstać. Wartość publikacji polega na tym, że czytelnik może odróżnić pytanie użytkownika od wygodnej metryki narzędzia i wskazać moment, w którym wynik przestaje być wystarczający do dalszej pracy.
02 / METHOD
Materiał i kontrprzykłady
Zestaw negatywny powinien zawierać dokumenty pozornie trafne: inną jurysdykcję, wersję nieobowiązującą, podobną nazwę podmiotu, inny etap procedury i cytat bez kontekstu. Materiał kontrolny nie ma potwierdzać tezy autora; jego zadaniem jest ujawnić przypadek, w którym prawdopodobny wynik jest niebezpiecznie mylący dla danego workflow.
03 / METHOD
Metoda kontroli
Protokół łączy retrieval, reranking, kontrolę metadanych i citation fidelity. Metryki takie jak Recall@k mają sens wyłącznie wtedy, gdy istnieje rzeczywisty zestaw truth i opisana jednostka zadania. Opis obejmuje kolejność kroków, wejście i ślad wyniku, aby niezależna osoba mogła sprawdzić, co zostało zmierzone oraz czego procedura w ogóle nie mierzy.
04 / METHOD
Macierz akceptacji
Macierz akceptacji określa, który błąd jest tolerowany w eksploracji, a który blokuje użycie wyniku w przygotowaniu materiału zawodowego. Kryteria są jawne przed odczytaniem rezultatu, dzięki czemu pojedynczy udany przykład nie może zastąpić kontroli nad krytycznym typem błędu.
05 / METHOD
Przekazanie i ponowny test
Po zmianie korpusu, modelu embeddingów lub filtra test uruchamia się ponownie z tą samą wersją przypadków i zapisem rozbieżności. Reprodukowalność obejmuje też możliwość pokazania, dlaczego następne uruchomienie różni się od poprzedniego i kto podejmuje decyzję o użyciu nowej wersji.
06 / METHOD
Granice wniosku
Przykład syntetyczny jest oznaczony jako syntetyczny i nie udaje publicznego benchmarku. Tekst nie deklaruje konkretnego wyniku modelu bez źródłowego zestawu danych. Z tego powodu materiał ma charakter metodyczny i nie udaje uniwersalnej recepty ani niezależnego potwierdzenia, którego nie przeprowadzono.
07 / METHOD
Przykład kontroli
Przykład kontrolny może celowo zawierać dwa podobne fragmenty: jeden z właściwej wersji źródła i drugi z błędną jurysdykcją albo datą. Jeśli wynik nie pozwala odróżnić ich przez cytat oraz wersję, podobieństwo nie jest jeszcze dowodem poprawnego retrievalu. Przykład jest syntetyczny, nie wynikiem pomiaru produkcyjnego.
08 / METHOD
Zapis źródła i review
W pakiecie review zapisuje się identyfikator zapytania, wersję korpusu, konfigurację retrievalu, oczekiwany fragment, faktycznie zwrócony fragment i decyzję człowieka. Recall@k ma sens wyłącznie wtedy, gdy taki oznaczony zestaw istnieje; bez niego nie należy przedstawiać liczby jako miary jakości.
09 / METHOD
Szczegół odtworzenia
Po zmianie embeddingów nie wystarczy porównać średniego podobieństwa. Uruchom ten sam oznaczony zestaw negatywny, zapisz identyfikator korpusu i filtrów oraz sprawdź, czy prawidłowy fragment nadal wygrywa z dokumentem o podobnym języku, lecz niewłaściwej dacie lub jurysdykcji. Różnicę w rankingu traktuj jako materiał do review, dopóki nie wyjaśni jej wersja danych albo zmiana reguły.
LIM
Ograniczenia i zakres
Wynik benchmarku zależy od domeny, korpusu i jednostki oceny; nie istnieje uniwersalny ranking baz wektorowych.
SRC
Źródła i wersja zewnętrzna
Oryginalny lub wcześniejszy materiał na Medium
Narzędzia AI wspierały przygotowanie struktury i redakcję. Ostateczna wersja przeszła human editorial review faktów, źródeł, wniosków i przypisania autorstwa.
LOG
Historia zmian
- Pierwsza rozszerzona wersja we własnym archiwum.
- Przegląd struktury, ograniczeń i powiązań dowodowych.