Самообучающиеся торговые AI-агенты: иллюзии, оверфиттинг и реальная архитектура

3 минут чтения •


Концепция автономного торгового агента, который «сам торгует, анализирует свои ошибки и дообучает стратегию 24/7», сейчас на пике хайпа. В сети появляется множество видео и промптов, обещающих превратить Claude Code или LLM-агентов в машины по генерации сверхприбыли.

Однако между красивыми демо-роликами и реальным рыночным продакшном лежит огромная пропасть. Разберем, где здесь маркетинг, где критические риски оверфиттинга, и как должна выглядеть архитектура надежного агентного контура.


Анатомия хайпа: 47% в месяц и «научный метод»

Типичный сценарий, который продвигают в платном доступе:

  1. One-shot prompt для Claude Code разворачивает стек на Railway / облаке.
  2. Агент подключается к API биржи и ведет позиции.
  3. Еженедельно агент анализирует ledger (историю сделок) и меняет веса стратегии.
  4. Заявляются цели уровня 40–50% в месяц при минимальных просадках.

В чем фундаментальные проблемы такого подхода?


Архитектура надежного контура

Если отбросить маркетинговую шелуху, сама идея разделения обязанностей между специализированными агентами вполне жизнеспособна. Но архитектура должна строиться по принципу изолированных контуров и жестких шлюзов (Approval Gates):

flowchart TD
    subgraph Orch ["🎛️ 1. Orchestrator (Hermes Agent)"]
        direction TB
        O1["Управление инфраструктурой (deploy, cron, health)"]
        O2["Сбор телеметрии и Append-Only Ledger"]
        O1 --- O2
    end

    subgraph Exec ["⚡ 2. Strategy Engine (Исполнение)"]
        direction TB
        E1["Детерминированный движок (Rust / Python / Freqtrade)"]
        E2["Строгий Risk Management (Max Drawdown, Sizing)"]
        E1 --- E2
    end

    subgraph Tuner ["📊 3. Out-of-Sample Tuner (Аналитик)"]
        direction TB
        T1["Бэктесты на независимой OOS-выборке со сдвигом"]
        T2["Отчет с гипотезами и метриками (Sharpe, Profit Factor)"]
        T1 --- T2
    end

    subgraph Gate ["🛡️ 4. Human Approval Gate"]
        direction TB
        G1["Ручной аудит гипотезы разработчиком"]
        G2["Применение флага live: true"]
        G1 ==> G2
    end

    Orch --> Exec
    Orch --> Tuner
    Tuner ==>|Предложение оптимизации| Gate
    Gate ==>|Апрув параметров| Exec

4 ключевых принципа для продакшна

1. Детерминированное исполнение отдельно от LLM

LLM не должна принимать решения по каждой свече на миллисекундах. Роль AI-агента — мета-оптимизация и аналитика: генерация идей, фильтрация аномалий, валидация гипотез. Исполнение ордеров и контроль рисков должны выполняться жестким детерминированным кодом.

2. Append-Only Ledger как единственный источник правды

Все события, котировки, сигналы и фактические исполнения логируются в неизменяемый JSONL-лог. Агент не может переписать историю — только прочитать ее.

3. Out-of-Sample валидация со сдвигом по времени

Тюнер стратегий никогда не должен оптимизировать параметры на тех же данных, где искались сигналы. Использование временного сдвига (например, 3–7 дневный лаг) защищает от оптимизации под случайные всплески волатильности.

4. Human-in-the-loop (Ручной шлюз)

Любые изменения в strategy.yaml или параметрах риск-менеджмента требуют явного подтверждения человеком. Переход paper → live выполняется только после прохождения OOS-гейта.


Первоисточники и материалы