Как обучать и оценивать AI-агентов: почему Pass@1 бесполезен и как работает связка SFT + GKD + GRPO
Инженерный разбор пост-тренинга и бенчмаркинга AI-агентов: от маскирования loss в SFT и on-policy дистилляции до RLVR (GRPO) и изолированных сред.
Показать все теги
Всего 2 публикаций
Инженерный разбор пост-тренинга и бенчмаркинга AI-агентов: от маскирования loss в SFT и on-policy дистилляции до RLVR (GRPO) и изолированных сред.
Разбор архитектуры self-improving trading agents: почему обещания 40%+ в месяц — это маркетинг, и как на самом деле строить надежные контуры с OOS-тюнингом и approval gates.