Artikel · AI & compliance
Kalibrering pr. use-case
En tærskel, der virker på én model og én opgave, er ikke et tal, man kan tage med sig. Det er den fejl, der oftest gør en gate til pynt.
AI & compliance · metode · ca. 3 min
Når man har fundet en grænse, der virker — modellen skal sige fra her, den må køre selv der —
er fristelsen at bruge den igen på næste opgave. Det er forståeligt. Det er også der, de fleste
gates holder op med at virke, uden at nogen opdager det.
Hvorfor tallet ikke kan flyttes
Signalet, en gate læser på, er en fordeling, ikke en fysisk konstant. Fordelingen flytter sig,
når noget under den flytter sig:
- Modellen. To modeller på samme opgave har forskellige fordelinger. En tærskel, der
rammer midt i den ene, kan ligge helt ude i halen på den anden.
- Platformen. Samme model serveret to steder er ikke nødvendigvis samme model i praksis
— kvantisering og serverings-opsætning ændrer det aflæste signal, uden at noget i jeres kode
ændrer sig.
- Opgaven. Korte svar og lange svar giver forskellige fordelinger. Multiple choice og
fritekst giver forskellige fordelinger. Profilerer man i ét format og måler i et andet,
sammenligner man ikke det samme.
En tærskel kopieret fra en anden opsætning ser ud til at virke — lige indtil den
dag, den skulle have fanget noget.
Hvad kalibrering indebærer
- Kør på jeres egen opgave med den model og den platform, I faktisk skal bruge. Ikke en
tilsvarende.
- Kør dybt nok til at finde loftet. Stopper man for tidligt, ser det ud som om systemet
er holdt op med at blive bedre, fordi man holdt op med at kigge.
- Analysér før I designer gaten. Fordelingen fortæller, hvor grænsen skal ligge. Sætter
man grænsen først og kigger bagefter, har man valgt et tal og derefter ledt efter en
begrundelse.
- Mål i samme format, som I evaluerer i. Ellers måler man én ting og beslutter på en
anden.
- Kalibrér igen, når noget skifter — model, version, leverandør eller opgave.
Den billige version
Det behøver ikke være stort. Et par snese repræsentative opgaver, kørt med de indstillinger,
I faktisk skal bruge, fortæller allerede, om der overhovedet er spredning nok til at sætte en
meningsfuld grænse.
Er der ikke det — ligger alt i den ene ende — så er svaret ikke en anden tærskel. Så er
svaret, at gaten ikke kan bære den beslutning på den opgave, og det er bedre at vide inden.
Hvorfor det hører til compliance
Artikel 15 beder om, at nøjagtighedsniveauet og målemetoderne oplyses. Et tal målt på en anden
model, en anden platform eller en anden opgave er ikke jeres nøjagtighedsniveau. Kalibrering er
dét, der gør forskel på et tal, I har, og et tal, der gælder jer.
Se også audit-pakken og den åbne måleprotokol.