Две новые модели для агентов, которые принимают изображения и видео.
Ox Alpha, анонимная тестовая модель: контекст 1 млн токенов, ответ до 131 тыс. токенов, вход в виде текста, изображений и видео, вызов инструментов и JSON-ответы. Сейчас модель бесплатна на OpenRouter, почти безлимитный доступ обещают неделю.
В раннем прогоне на 10 задачах DeepSWE: Ox Alpha 80%, Fable 5 65%, GLM-5.3 и Grok 4.6 по 62%, GPT-5.6 Sol 52%. Автор теста предупреждает о маленькой выборке и возможной погрешности. Кто создал модель, официально не раскрыто.
DeepSeek-V4-Flash-Vision-Exp, экспериментальная версия V4 Flash с распознаванием изображений, цена API как у V4 Flash. Одно изображение после сжатия занимает до 384 входных токенов. Есть Files API: картинку можно загрузить один раз и передавать агенту по file_id.
Первые пользователи хвалят создание интерфейсов по скриншоту, но это личные впечатления.