656 случаев показали слабость интерактивного выполненияИсследование SafeActBench выявило, что агенты часто прекращают расследование или действуют без сбора доказательств, хотя в статике их оценки кажутся надежными. В многошаговых рабочих процессах эти проблемы усугубляются нерешенными предварительными условиями.
arXiv cs.CLAI
- Область
- применение языковых моделей
- Что сделали
- Исследователи изучили, как агенты, использующие инструменты, ошибаются при переходе от оценки необходимости действия к его реальному выполнению, и ввели бенчмарк SafeActBench для проверки этого процесса.
- Зачем это
- Это поможет понять, почему агенты часто прекращают расследование или начинают действовать раньше времени, что важно для повышения надежности автоматизированных систем.
#ai safety#alignment#reinforcement learning#tool use#agent evaluation
Читать оригинал →