Vi har testet den påstand
I stedet for at påstå det har vi målt det. 345 juridiske spørgsmål inden for dansk og EU-ret, hvert med et verificerbart korrekt svar fra officielle kilder. Disse fire er de mål, hvor en model uden juridisk database stadig kan vinde, og derfor er de den fair sammenligning. Højere er bedre i alle rækker.
| Måling | eulaw.ai | GPT-5.6 | Claude Sonnet 5 |
|---|
| Love, den nævnte, som rent faktisk findes | 82% | 15% | afviste |
|---|
| Samtaler over flere spørgsmål håndteret korrekt | 96% | 71% | 73% |
|---|
| Stadig korrekt 100 spørgsmål inde i en samtale | 75% | 34% | 0% |
|---|
| Juridisk indhold, bedømt på de anførte fakta | 69% | 66% | 59% |
|---|
Den første række betyder mest. Adspurgt hvilke love der havde ændret en given lov, nævnte GPT-5.6 59 love, der ikke findes. Claude afviste spørgsmålet frem for at svare, hvilket er sikrere, men ikke mere brugbart. På tværs af hele sættet henviser 9 ud af 10 svar fra eulaw.ai til præcis den lov, der blev spurgt om, og ingen svarer uden kilde.
Læs hele benchmarken med alle grafer og samtlige 345 spørgsmål
Målt i august 2026 på 345 spørgsmål. GPT-5.6 og Claude Sonnet 5 blev testet via deres API uden juridisk database, websøgning eller opslag. Sådan bruger en jurist ikke de to produkter, og vi offentliggør en ny sammenligning mod forbrugerapps med søgning slået til. Vi har udeladt de mål, en model uden database per definition ikke kan vinde, for eksempel at nævne love vedtaget efter dens træningsgrænse, hvor forskellen er langt større og langt mindre meningsfuld.