PRIME-RL: мультиагентное RL-обучение ИИ-агентов

2026-08-11 · Бельский.ком
PRIME-RL: мультиагентное RL-обучение с изменением весов модели Команда Prime Intellect расширила среду PRIME-RL: теперь она управляет сразу несколькими агентами и использует их взаимодействие для обучения. Разработчик описывает роли через Agent, задаёт взаимодействие и награду через Env — и запускает обучение. Три сценария: • Agentic Judging — агент-решатель выполняет задачу, а агент-судья разбирает его трассу: шаги, код, тесты, результат • Self-Play — модель играет разные роли против самой себя и усложняет задачи по мере роста • User-Sim — замороженный пользователь-агент со скрытой целью обучает ассистента вести длинный диалог до результата Для простого самообучения есть команда /refine: она превращает опыт текущей сессии в память, инструкции и скиллы. В prime-agent изменения планирует отдельный refiner с JSON-планом и откатом, в Hermes — фоновый экземпляр агента со снимком разговора. Автор сравнил prime-agent с Hermes по 14 категориям: prime проигрывает в безопасности, памяти и скиллах, но выигрывает в оркестрации и программируемости. Это личные тесты, а не бенчмарк.
Подписывайтесь на наши каналы:
← Все новости