Rettelse af målegrundlaget
14. juli 2026
Vi har fundet og rettet to fejl i vores målegrundlag. De påvirkede de resultater, vi har offentliggjort frem til i dag, og de påvirkede dem på en måde, der gjorde vores rangeringer mindre pålidelige. Her er, hvad der var galt.
Fejl 1: Korrekt dansk blev registreret som forkert sprog
Svar skrevet på korrekt dansk blev i mange tilfælde registreret, som om modellen ikke havde svaret på dansk. Fejlen ramte ikke modellerne ens: den slog hårdest på korte svar og dermed skævt mellem modeller.
Konsekvensen er, at vores sprogresultater målte noget andet end det, vi sagde, de målte. Enkelte modeller blev trukket for dansk, der var helt i orden.
Fejl 2: De stærkeste modeller fik ikke lov at svare færdigt
Modeller, der ræsonnerer sig gennem en opgave, før de svarer, fik deres svar afkortet. De blev dermed målt, som om de ikke havde løst opgaven — selv om de aldrig fik mulighed for at fuldføre den.
Det ramte flere af de stærkeste modeller på markedet. Værre: nogle af dem faldt ud af vores udvalg på grundlag af målinger, de aldrig fik lov at lave, og fik dermed ikke chancen for at komme tilbage.
Hvad vi har gjort
Begge fejl er rettet.
Vi gemmer de oprindelige svar fra alle modeller og har derfor kunnet genberegne hele historikken fra kilden. Målinger, der blev ødelagt af den anden fejl, er kasseret — vi lader dem ikke tælle mod modellerne, da fejlen var vores.
Modellerne, der uretmæssigt faldt ud af udvalget, er sat tilbage til test.
Vi har desuden taget en ny og strengere vurdering af sprogkvalitet i brug, som måler, hvor godt dansken faktisk er skrevet — ikke blot om svaret er på dansk.
Tidligere ugerapporter er trukket tilbage
Ugerapporterne, vi har offentliggjort frem til i dag, byggede på tal, vi nu ved var forkerte. De er derfor trukket tilbage i deres helhed. Vi lader dem ikke stå korrigeret bagefter, fordi de ikke lader sig rekonstruere ærligt.
Hvorfor vi skriver dette
hvilkenAI er en måletjeneste. Vores værdi er, at tallene passer. Når de ikke gør det, er det eneste, der er noget værd, at vi siger fra.
Vi har ingen affiliate-aftaler, sponsorerede placeringer eller kommercielle bindinger til de AI-leverandører, vi tester. Det gælder fortsat, og det er netop derfor, vi ikke har nogen grund til at skjule dette.