SMITH объединяет создание и использование инструментов для агентов LLMНовая методология SMITH объединяет обучение генерации кода и его вызова в единой политике, используя три независимых канала вознаграждения для коррекции ошибок в схеме, коде и результате. Тестирование проводилось на модели Qwen3 размером 4 миллиарда параметров.
HackerNews AILLM
- Область
- обучение языковых моделей
- Что сделали
- Исследователи предложили метод SMITH, который одновременно обучает языковую модель создавать инструменты и использовать их, объединяя эти задачи в одну систему.
- Зачем это
- Это позволяет модели получать обратную связь по ошибкам в схеме кода, написанном коде и результатах выполнения, что делает её более эффективной в работе с инструментами.
#llm#tool use#reinforcement learning#qwen3#schema grounding
Читать оригинал →