PRIME-RL: мультиагентное RL-обучение с изменением весов модели
Команда Prime Intellect расширила среду PRIME-RL: теперь она управляет сразу несколькими агентами и использует их взаимодействие для обучения. Разработчик описывает роли через Agent, задаёт взаимодействие и награду через Env — и запускает обучение.
Три сценария:
• Agentic Judging — агент-решатель выполняет задачу, а агент-судья разбирает его трассу: шаги, код, тесты, результат
• Self-Play — модель играет разные роли против самой себя и усложняет задачи по мере роста
• User-Sim — замороженный пользователь-агент со скрытой целью обучает ассистента вести длинный диалог до результата
Для простого самообучения есть команда /refine: она превращает опыт текущей сессии в память, инструкции и скиллы. В prime-agent изменения планирует отдельный refiner с JSON-планом и откатом, в Hermes — фоновый экземпляр агента со снимком разговора.
Автор сравнил prime-agent с Hermes по 14 категориям: prime проигрывает в безопасности, памяти и скиллах, но выигрывает в оркестрации и программируемости. Это личные тесты, а не бенчмарк.