Interpreter.ru 🛡 В админку
Нейросети и ИИ 04.09.2026 рейтинг 6

Оптимизация маломасштабной модели LFM2.5-350M для структурированного вывода

Оптимизация маломасштабной модели LFM2.5-350M для структурированного вывода
В последние годы модели с большим количеством параметров (LLM) стали неотъемлемой частью многих приложений, от чат-ботов до систем автоматизации. Однако, несмотря на их мощь, многие из них сталкиваются с проблемами при генерации структурированных выходных данных. В этой статье мы рассмотрим процесс дообучения модели LFM2.5-350M с использованием метода Group Relative Policy Optimization (GRPO) для повышения ее способности к соблюдению схемы структурированного вывода.

Основы структурированного вывода

Структурированный вывод — это задача, требующая от модели генерации данных в определенном формате, например, JSON или YAML. Это особенно важно для интеграции моделей в системы, где корректность формата данных критична. В большинстве случаев, производительность моделей на таких задачах измеряется в рамках более широких оценок, что затрудняет понимание их реальных возможностей в этой области.

Подход к дообучению

Для улучшения производительности модели LFM2.5-350M мы используем библиотеку TRL и проводим дообучение на 500 образцах с использованием метода GRPO. Этот процесс занимает всего 100 шагов обучения, что делает его доступным для выполнения на бесплатных GPU, таких как Google Colab или Kaggle.

Оценка исходной модели

Перед началом дообучения мы оцениваем LFM2.5-350M на бенчмарке IFStruct, который предназначен для проверки корректности выходных данных и соблюдения схемы. Исходные результаты показывают, что модель достигает 22.6% успешных выводов на 2000 тестовых образцах. Это значение близко к 21.1%, указанному в блоге IFStruct, что подтверждает корректность нашей настройки.

Подготовка к дообучению

Для дообучения мы используем набор данных nvidia/Nemotron-RL-instruction_following-structured_outputs, который включает пары запросов и ожидаемых выходных данных в формате JSON. Мы добавляем инструкции, чтобы модель училась генерировать выходные данные в нужном формате. Например, 40% запросов получают инструкцию "вернуть вывод в огражденном кодовом блоке", а 20% преобразуются в задачи с верхним уровнем массива.

Настройка модели и LoRA

Мы загружаем модель LiquidAI/LFM2.5-350M и прикрепляем адаптер LoRA, который позволяет нам дообучать модель, не изменяя ее основные параметры. Это позволяет нам сосредоточиться на специфических для задачи модулях, что значительно упрощает процесс дообучения.

Определение функций вознаграждения

Для оценки качества выходных данных мы определяем три функции вознаграждения:
  • json_format_reward: проверяет, является ли вывод парсируемым и соответствует ли запрашиваемой форме.
  • field_count_reward: оценивает, соответствует ли объект ожидаемому количеству верхних полей.
  • schema_validation_reward: проверяет, соответствует ли вывод заданной JSON-схеме.
  • Эти функции комбинируются в взвешенную сумму, что позволяет более точно оценивать качество выходных данных.

    Процесс дообучения

    Мы проводим 100 шагов обучения с 8 генерациями на группу запросов, что позволяет эффективно использовать ресурсы доступного GPU. В процессе обучения наблюдается рост всех трех компонентов вознаграждения, что указывает на улучшение качества выходных данных.

    Оценка после дообучения

    После завершения дообучения мы снова проводим оценку модели на бенчмарке IFStruct. Результаты показывают, что модель теперь достигает 29.7% успешных выводов, что является значительным улучшением по сравнению с исходными 22.6%. Это подтверждает, что даже легкое дообучение может существенно повысить надежность модели в задачах структурированного вывода.

    Заключение

    Таким образом, использование метода GRPO для дообучения модели LFM2.5-350M на небольшом наборе данных позволяет значительно улучшить ее производительность в задачах структурированного вывода. Это открывает новые возможности для применения маломасштабных моделей в реальных приложениях, где важна точность и корректность формата выходных данных.
    Источник:   Hugging Face Blog