Benchmarks

Benchmarks van AI-workflows

Openbare vergelijkingen van Claude, Codex en Qwen op ontwikkelworkflows.

Status · nog geen resultaten gepubliceerd

De eerste benchmark is in voorbereiding

Hier verschijnt niets totdat een run klaar is. Dan staat hij op deze pagina, met een link naar het volledige verslag.

Wat elke gepubliceerde run bevat

Systemen
Elk vergeleken hulpmiddel en model, met de exacte versie.
Datum
Wanneer de run is uitgevoerd.
Taken
Welke workflows elk systeem moest uitvoeren, en hoeveel.
Beoordeling
Hoe de resultaten zijn beoordeeld — de methode, uitgeschreven.
Resultaten
Grafieken met de onderliggende cijfers in een toegankelijke tabel.
Ruwe data
Een downloadbaar bestand met de ruwe resultaten.