Hvordan ved man, at en AI ikke digter?
Spørg en AI om noget, og den svarer. Den svarer også, når den ikke ved det. Det er den egenskab, der gør sprogmodeller både nyttige og farlige: svaret lyder lige sikkert, uanset om det er rigtigt eller opdigtet.
Det svar de fleste giver på det problem, er et løfte: vores AI finder ikke på noget.
Vi giver et andet svar. Trail er vores videnmotor: virksomhedens ekstra hjerne, som både teamet og en AI trækker deres viden fra. Trail er bygget til at måle, om den digter. Hver nat.
Et løfte kan ikke tjekkes. En måling kan.
Man kan ikke se på et svar, om det er rigtigt. Man kan kun holde det op mod noget, man ved er rigtigt. Derfor starter al kvalitetskontrol i Trail samme sted: med en facit.
Vi bygger testsæt ud fra hjernens egne data. Spørgsmål, hvor vi på forhånd ved, hvilket svar og hvilken kilde der er den rigtige. Så kan vi tælle, hvor ofte Trail rammer.
Men en måling kan også lyve. Den kan give pæne tal, fordi den er for nem at bestå. Derfor kører der altid en kontrol ved siden af: de samme spørgsmål med bevidst forkerte svar. Den kontrol scorer 2–3 %. Det er beviset på, at målingen faktisk kan se forskel på rigtigt og forkert. Uden den kontrol ville et flot tal intet betyde.
Det første, målingen fandt
Trail søger på to måder på én gang. Den søger på ord: står det, du spurgte om, i teksten? Og den søger på betydning: handler teksten om det, du spurgte om, selv med andre ord? Den kombination kaldes hybrid-søgning, og det lyder oplagt, at to måder er bedre end én.
Det var de ikke. Første måling viste, at hybrid-søgningen var en anelse dårligere end ren ordsøgning til at sætte det rigtige svar øverst.
Vi gættede ikke på, hvorfor. Vi justerede, hvor meget de to måder hver får at sige, og gav ordsøgningen mere vægt (betydningen fik 0,15 af stemmen). Så målte vi igen:
- 59 % rigtigt svar blandt de fem øverste med hybrid, mod 53 % med ordsøgning alene, på den faire test.
- 75 % mod 71 % hos en kunde-hjerne.
Prisen er omkring et halvt sekund ekstra pr. søgning. Det valg er taget med vilje: lidt langsommere, men bedre svar. Pointen er ikke tallet i sig selv. Pointen er, at vi ville have troet det modsatte, hvis vi ikke havde målt.
Brain Health: fire tjek hver nat
Den måling er blevet en fast rutine, som vi kalder Brain Health. Hver nat tjekker Trail en hjerne på fire måder:
- Svar uden kilder. Hvor mange svar blev givet uden at pege på, hvor de kommer fra?
- Fælde-spørgsmål. Kender den svaret, når den burde? Og siger den «det ved jeg ikke», når den ikke gør?
- Påstandskontrol. Står det, svaret siger, faktisk i kilderne? Og står det, en Neuron indeholder, faktisk i den kilde, den blev lavet ud fra?
- Søgekvalitet. Finder den stadig det rigtige, målt mod facit?
Også her er der en indbygget kontrol: hver nat viser den, at bedømmeren selv kan skelne rigtigt fra forkert. En dommer, der godkender alt, er ingen dommer.
Resultatet står på hjernens Sundhed-side, med tal og udvikling over tid. Bliver en hjerne dårligere, kan man se det — og se hvornår det begyndte.
Det kræver, at svarene kommer tilbage
Man kan ikke måle det, man ikke ser. Derfor er det en betingelse, at alt, der bruger Trail, melder sine svar tilbage.
- Teksten gemmes i 30 dage og slettes derefter automatisk. Teksten gemmes krypteret, og Trails udviklere har ikke direkte adgang til at læse den.
- Tallene gemmes for evigt, så udviklingen over tid kan følges.
- Data ligger i EU, i Stockholm.
- Der er et beløbsloft pr. hjerne pr. dag, så en nattelig kontrol aldrig bliver en overraskelse på regningen.
Den ærligste måling
Da vi byggede kontrollen, målte vi også noget, vi ikke havde regnet med at blive klogere af. Vi bad to stærke sprogmodeller, Sonnet og Opus, om at sige, hvilke emner en kilde handler om. De var kun enige i 35 % af tilfældene.
Det er den vigtigste lektie i hele arbejdet. Hvis to stærke modeller kun er enige om en tredjedel, kan kvalitet ikke måles ved at spørge en model, om svaret virker godt. Den skal måles mod en konkret facit. Alt andet er en fornemmelse.
Et af de vigtigste aktiver, vi har
Kvalitetskontrollen er ikke et tillæg til Trail. Den er et ekstremt vigtigt aktiv i vores udvikling og forskning af Trail. En Trail-hjerne rummer en kundes samlede viden, så når vi kontrollerer kvaliteten af vores teknologi, kontrollerer vi også kvaliteten af vores kunders hjerner.
Det er også det, der lader os blive bedre uden at gætte. Når vi ændrer noget i Trail, kan vi måle, om det blev bedre — sådan som søgningen ovenfor viste. Og gør en forbedring noget andet dårligere, ser vi det med det samme.
Hvorfor det betyder noget for jer
Når en AI skal svare på vegne af jeres virksomhed — til kunder, medarbejdere eller jer selv — er spørgsmålet ikke, om den kan digte. Det kan de alle. Spørgsmålet er, om nogen opdager det, når den gør.
I Trail bliver det opdaget. Om natten, med tal, mod en facit.
Tal det igennem med Christian, hvis I vil vide, hvad det betyder for jeres egen viden.
Trail er virksomhedens ekstra hjerne: en videnmotor, der samler alt, hvad virksomheden ved, i én base, som både teamet og en AI kan søge og svare ud fra. Med kilder, og med kvaliteten målt hver nat.