AGAR позволяет менять оценщики без изменения управленияМетод формализует поиск алгоритмов как марковский процесс принятия решений, позволяя приписывать кредит за результат конкретным компонентам кода. Это устраняет необходимость ручного подбора пяти констант, управляющих эволюцией.
arXiv cs.AIAI
- Область
- обучение языковых моделей
- Что сделали
- Исследователи сформулировали алгоритмическую задачу как марковский процесс принятия решений, чтобы приписать вознаграждение за конкретные части программы, используя оценочные функции из обучения с подкреплением.
- Зачем это
- Это позволяет заменять или отключать любые оценочные функции без изменения управления процессом, что дает гибкость в поиске алгоритмов.
#reinforcement learning#llm#program evolution#algorithm discovery#markov decision process
Читать оригинал →