Berkeley и Arena прогнали 7 моделей через Claude Code, Codex и Pi и сравнили цену и результат.
🔹 Fable 5 на SWE-bench Lite: Claude Code дал 97,8% успешных попыток по $1,33 за попытку, Pi показал 96,7% за $0,67
🔹 Разница в качестве чуть больше одного процента, а цена почти вдвое ниже. Шагов потрачено почти поровну: 15,3 против 15,4, зато стартовый контекст у Claude Code в среднем в 10 раз больше
🔹 Привязка к провайдеру не всегда помогает: Opus 4.8 в Codex решил больше задач, чем в Claude Code
Тест скромный: 30 задач из двух бенчмарков, стоимость считали по API, а не по подпискам. Сносить Claude Code не спешите. Но если платите за токены, сначала попробуйте ту же модель в другой обвязке, а не переключайтесь на модель подороже.
Сайт проекта: https://clck.su/wBvuy
Полная статья: https://clck.su/wBvuy