В Berkeley и Arena прогнали семь моделей через Claude Code, Codex и Pi. Главный вывод: смена harness меняет цену работы сильнее, чем смена модели.
Fable 5 на SWE-bench Lite в Claude Code решает 97,8% задач, попытка стоит $1,33. Та же модель в Pi: 96,7% за $0,67. Почти двукратная разница в цене ради +1,1% успеха. Шагов при этом примерно одинаково (15,3 против 15,4), а стартовый контекст у Claude Code в среднем больше в 10 раз.
Привязка к провайдеру не всегда помогает: Opus 4.8 в Codex решил больше задач, чем в Claude Code.
Оговорки: тест 30 задач из двух бенчмарков, стоимость считалась по API, а не по подпискам. Но если вы платите за токены, попробовать ту же модель в другом harness может быть полезнее, чем переходить на более дорогую модель.
Полная статья: https://clck.su/wBvuy