2026-08-11
PRIME-RL: мультиагентное RL-обучение ИИ-агентов
PRIME-RL: мультиагентное RL-обучение с изменением весов модели
Команда Prime Intellect расширила среду PRIME-RL: теперь она управляет сразу несколькими агентами и использует их взаимодействие для обучения. Разработчик описывает роли через Agent, задаёт взаимодействие и награду через Env — и запускает обучение.
Три сценария:
• Agentic Judging — агент-решатель выполняет задачу, а агент-судья…
Читать полностью →