Rettelse af målegrundlaget

14. juli 2026

Vi har fundet og rettet to fejl i vores målegrundlag. De påvirkede de resultater, vi har offentliggjort frem til i dag, og de påvirkede dem på en måde, der gjorde vores rangeringer mindre pålidelige. Her er, hvad der var galt.

Fejl 1: Korrekt dansk blev registreret som forkert sprog

Svar skrevet på korrekt dansk blev i mange tilfælde registreret, som om modellen ikke havde svaret på dansk. Fejlen ramte ikke modellerne ens: den slog hårdest på korte svar og dermed skævt mellem modeller.

Konsekvensen er, at vores sprogresultater målte noget andet end det, vi sagde, de målte. Enkelte modeller blev trukket for dansk, der var helt i orden.

Fejl 2: De stærkeste modeller fik ikke lov at svare færdigt

Modeller, der ræsonnerer sig gennem en opgave, før de svarer, fik deres svar afkortet. De blev dermed målt, som om de ikke havde løst opgaven — selv om de aldrig fik mulighed for at fuldføre den.

Det ramte flere af de stærkeste modeller på markedet. Værre: nogle af dem faldt ud af vores udvalg på grundlag af målinger, de aldrig fik lov at lave, og fik dermed ikke chancen for at komme tilbage.

Hvad vi har gjort

Begge fejl er rettet.

Vi gemmer de oprindelige svar fra alle modeller og har derfor kunnet genberegne hele historikken fra kilden. Målinger, der blev ødelagt af den anden fejl, er kasseret — vi lader dem ikke tælle mod modellerne, da fejlen var vores.

Modellerne, der uretmæssigt faldt ud af udvalget, er sat tilbage til test.

Vi har desuden taget en ny og strengere vurdering af sprogkvalitet i brug, som måler, hvor godt dansken faktisk er skrevet — ikke blot om svaret er på dansk.

Tidligere ugerapporter er trukket tilbage

Ugerapporterne, vi har offentliggjort frem til i dag, byggede på tal, vi nu ved var forkerte. De er derfor trukket tilbage i deres helhed. Vi lader dem ikke stå korrigeret bagefter, fordi de ikke lader sig rekonstruere ærligt.

Hvorfor vi skriver dette

hvilkenAI er en måletjeneste. Vores værdi er, at tallene passer. Når de ikke gør det, er det eneste, der er noget værd, at vi siger fra.

Vi har ingen affiliate-aftaler, sponsorerede placeringer eller kommercielle bindinger til de AI-leverandører, vi tester. Det gælder fortsat, og det er netop derfor, vi ikke har nogen grund til at skjule dette.

Se dagens benchmark →