Five constants govern the program rewriting loopThe method formalizes algorithm search as a Markov decision process, enabling credit assignment to specific code components. This removes the need for manually tuning five constants that govern program evolution.
arXiv cs.AIAI
- Field
- training language models
- What they did
- Исследователи сформулировали алгоритмическую задачу как марковский процесс принятия решений, чтобы приписать вознаграждение за конкретные части программы, используя оценочные функции из обучения с подкреплением.
- Why it matters
- Это позволяет заменять или отключать любые оценочные функции без изменения управления процессом, что дает гибкость в поиске алгоритмов.
#reinforcement learning#llm#program evolution#algorithm discovery#markov decision process
Read the original →