Бенчмарки

Бенчмарки AI-процесів

Публічні порівняння Claude, Codex і Qwen на процесах розробки.

Статус · результатів ще не опубліковано

Перший бенчмарк готується

Тут нічого не з'явиться, доки запуск не буде завершено. Тоді він буде на цій сторінці з посиланням на повний звіт.

Що міститиме кожен опублікований запуск

Системи
Кожен інструмент і модель, які порівнюються, з точною версією.
Дата
Коли проводився запуск.
Завдання
Які процеси мала виконати кожна система і скільки їх було.
Оцінювання
Як оцінювали результати — методика, детально описана.
Результати
Графіки з вихідними числами в доступній таблиці.
Сирі дані
Файл із сирими результатами для завантаження.