Как обучать и оценивать AI-агентов: почему Pass@1 бесполезен и как работает связка SFT + GKD + GRPO
Инженерный разбор пост-тренинга и бенчмаркинга AI-агентов: от маскирования loss в SFT и on-policy дистилляции до RLVR (GRPO) и изолированных сред.
Показать все теги
Всего 2 публикаций
Инженерный разбор пост-тренинга и бенчмаркинга AI-агентов: от маскирования loss в SFT и on-policy дистилляции до RLVR (GRPO) и изолированных сред.
Инженерный разбор RL-систем для финансовых рынков: квантование состояний в нейроны памяти, z-score инварианты, Q-learning и ансамблевый Collective Mind.