Пять агентов, одно мнение: как проверить пользу торговых дебатов

Пять торговых агентов рекомендуют купить актив. Один рассуждает о фундаментальных показателях, другой о новостях, третий о графике. Согласие выглядит убедительно, пока не выясняется, что все прочитали один пересказ отчета, а последние двое изменили решение после знакомства с первым ответом. Голосов пять; сколько здесь самостоятельных оснований для сделки, неизвестно.
В обзорах AI Hedge Fund, TradingAgents и AutoHedge мы разбирали распределение ролей и путь от анализа до решения. Следующий шаг — измерить, что дает само обсуждение. Для этого нужны сохраненные ответы до дебатов, контроль без обмена мнениями и учет дополнительного вычисления. Ниже — исследования, математический пример и предлагаемый протокол. Собственных торговых прогонов LLM в этой статье нет.
Красивое обоснование и полезное решение измеряются отдельно

В Multi-Agent Debate for Explainable Trading на 210 прогонах корреляция оценки рассуждений с Sharpe составила лишь 0,07 при p = 0,29. В отдельном вмешательстве, ограничивающем сближение позиций, Sharpe вырос на 0,14 по 35 сценариям, p = 0,028. Авторы не моделировали торговые издержки и допускают утечку исторических событий через обучение моделей. Это результаты симуляции, а не подтвержденный заработок. Полный текст, разделы 3.2, 3.4.2 и 5.1.
Из этого не следует, что надо заставлять агентов спорить бесконечно. Противоположные рекомендации можно получить и случайным изменением промпта. Само расстояние между портфелями не показывает, какой аргумент верен. Полезный вопрос уже: исправилось ли решение благодаря проверяемому возражению, которое без обсуждения осталось бы незамеченным?
Работа When Debate Helps, опубликованная 3 октября 2026 года, разделяет наличие правильного предложения и его выбор. Авторы меняют предъявляемые аргументы при фиксированном наборе предложений и проверяют влияние на ответ. Исследование относится к задачам рассуждения; перенос на торговлю требует отдельного опыта. Полный текст, разделы 3, 5 и приложение A.9.
Для торговой системы полезно принять это разделение как исследовательский инструмент. Сначала проверить фактический слой: верно ли извлечено число, относится ли новость к нужной компании, была ли публикация доступна к моменту решения. Затем — прогноз: помогает ли этот факт предсказать заранее выбранный исход. И только после этого — портфель: сохраняется ли польза после ограничений и исполнения. Успех на первом уровне не является измерением третьего.
Это продолжает вопрос из разбора Jev-ботов: какой компонент действительно создал результат? Здесь компонентом, который предстоит включать и выключать, становится обмен аргументами.
Независимость начинается до первого сообщения соседу

Предлагаю различать три свойства. Разнообразие входов означает разные наблюдения. Разнообразие выводов означает разные прогнозы или веса. Слабая зависимость ошибок означает, что агенты не промахиваются одновременно слишком часто. Одно свойство не доказывает другое.
Две новостные заметки могут пересказывать один пресс-релиз. Два агента с общим документом могут найти разные ошибки в расчетах. Разные веса портфеля могут отражать только разные лимиты риска. Поэтому подсчет сайтов, ролей или несогласных ответов по отдельности не измеряет независимую информацию.
До обсуждения нужно заморозить первоначальный ответ каждого агента. В минимальном журнале сохранить:
| Поле | Что оно позволяет проверить |
|---|---|
| Время доступности документа и идентификатор первоисточника | Не появилась ли информация позже решения; не пересказывают ли источники друг друга |
| Проверяемое утверждение и место в документе | Поддерживает ли ссылка именно этот факт |
| Первоначальный прогноз и уверенность | Что агент решил без влияния других участников |
| Прогноз после обсуждения и причина изменения | Какое возражение связано с пересмотром |
| Проверка возражения вне текста дебатов | Исправлена ли фактическая ошибка или расчет |
Последнее поле не требует новой LLM. Число из таблицы можно сверить с документом, арифметику — пересчитать кодом. В материале об извлечении сигналов из отчетов рассматривается получение признаков из текста; здесь журнал нужен, чтобы проследить, что обсуждение сделало с этими признаками.
Повторная ссылка на тот же факт не добавляет наблюдение. Но новое вычисление из известных данных может быть полезным: например, один агент заметил, что другой перепутал процентное изменение с процентными пунктами. Тогда в журнале появится исправленная операция, а не запись "три коллеги согласились".
Падение расхождения между ответами после такого исправления нормально. Падение расхождения без нового проверенного основания — сигнал для разбора. Оно еще не доказывает подражание: несколько агентов могли независимо устранить одну ошибку. Именно поэтому журнал дополняет измерение результатов, а не заменяет его.
Почему пять голосов могут быть эквивалентны полутора

Рассмотрим собственную математическую иллюстрацию. Пусть у каждого из n прогнозов ошибка с нулевым средним, одинаковой дисперсией σ² и одинаковой попарной корреляцией ρ. У среднего прогноза:
Var(средняя ошибка) = σ² × [1 + (n − 1)ρ] / n
n_eff = n / [1 + (n − 1)ρ]
Первая формула получается сложением n дисперсий и n(n − 1) ковариаций с последующим делением на n². Вторая определяет число независимых прогнозов с той же дисперсией среднего. Это эквивалент по дисперсии, а не количество фактов и не оценка точности голосования.
При n = 5 и ρ = 0,6 получаем n_eff ≈ 1,47. Увеличение числа агентов до десяти при той же корреляции дает лишь 1,5625. При систематическом общем смещении эта формула еще и недооценивает проблему: усреднение само по себе смещение не убирает.
Чтобы отдельно посмотреть на большинство голосов, зададим искусственную модель. Каждый участник прав с вероятностью 0,6. С вероятностью ρ все получают один общий случайный ответ с той же точностью; иначе отвечают независимо. В этой конкретной конструкции корреляция индикаторов правильности точно равна ρ.
| Заданная корреляция | Эквивалент независимых голосов по дисперсии | Вероятность правильного большинства |
|---|---|---|
| 0,0 | 5,000000 | 0,682560 |
| 0,3 | 2,272727 | 0,657792 |
| 0,6 | 1,470588 | 0,633024 |
| 1,0 | 1,000000 | 0,600000 |
Это точный перебор 32 сочетаний голосов, без случайной симуляции. Скрипт на стандартной библиотеке Python проверяет сумму вероятностей, точность каждого участника, все попарные корреляции и дисперсию среднего:
python3 multi-agent-debate-independent-evidence.py
Таблица показывает эффект выбранной зависимости. Она не описывает поведение настоящих LLM и ничего не говорит о доходности. Другой совместный закон с теми же попарными корреляциями может дать другую точность большинства. В реальном опыте корреляцию ошибок придется оценивать на отложенных исходах; согласие в одной торговой сессии для этого недостаточно.
Контрольный опыт: сохранить предложения, поменять обсуждение

Ниже — предлагаемый протокол, который мы еще не запускали. Его единица наблюдения — заранее выбранное событие или момент решения. На каждом событии сохраняются исходные предложения; затем один и тот же комплект направляется в несколько вариантов обработки.
| Вариант | Что происходит после исходного ответа | Зачем нужен |
|---|---|---|
| Один агент | Берется ответ участника, выбранного заранее | Начальная точка сравнения |
| Независимый ансамбль | Исходные прогнозы усредняются без общения | Отделяет пользу нескольких ответов |
| Самостоятельная проверка | Каждый проверяет свой ответ, не видя соседей; результаты усредняются | Контролирует дополнительное вычисление |
| Дебаты | Участники видят аргументы друг друга, пересматривают ответы; результаты усредняются | Измеряет добавку от взаимодействия |
В последней паре вариантов фиксируются модели, данные, число раундов, ограничения риска и одинаковый верхний бюджет токенов. Фактическое потребление тоже записывается: одинаковый лимит не означает одинаковую стоимость. Правило усреднения остается общим, иначе замена агрегатора смешается с эффектом дебатов.
Если нужен агент-судья, потребуется еще одна пара: тот же судья над первоначальными ответами и над результатами обсуждения. Улучшение относительно простого среднего само по себе не объяснит, помогли ли дебаты или только судья. Отдельным вмешательством можно разрешить получение новых документов; смешивать его с изменением общения не следует.
Для прогнозов нужно заранее определить проверяемый исход и горизонт. Для портфелей дополнительно задать доступные инструменты, лимиты, правило превращения прогнозов в позиции и исполнение. Равновзвешенный портфель с теми же ограничениями и учетом денежных остатков остается необходимым ориентиром: сложная система может проиграть простому распределению капитала.
Промпты и критерии остановки выбираются на периоде разработки. Затем их фиксируют и проверяют на следующем временном участке. Для исторических LLM-тестов остается вопрос о знании будущих событий из обучения; перспективный сбор ответов до появления исходов дает более сильную проверку.
Повторы генерации показывают изменчивость модели, но не создают новые рыночные события. Пять ответов на одну новость нельзя учитывать как пять независимых подтверждений. Неопределенность разницы между вариантами нужно оценивать с учетом общих дат и перекрывающихся горизонтов, например блоками времени; способ группировки задается до просмотра результата. Невалидные и просроченные ответы учитываются по общему заранее выбранному правилу, включая их стоимость.
Такой опыт оценивает эффект протокола внутри заданного симулятора. Он не устанавливает причину движения рынка и не доказывает статистическую независимость источников.
Дополнительный раунд должен оправдать свой счет

Экономику обсуждения следует считать вместе с качеством. Обзор Agentic Trading, обновленный 4 октября 2026 года, отдельно разбирает временные разбиения, издержки и правила исполнения при оценке агентных систем. Это полезный контекст для протокола, а не независимое подтверждение эффективности дебатов. Полный текст обзора.
Стоимость всех вызовов за один момент решения можно записать без привязки к текущим тарифам:
C_model = Σq (T_in,q × P_in,q + T_out,q × P_out,q) / 1 000 000
T — фактически оплачиваемые токены вызова, P — соответствующая цена за миллион токенов. Отдельные тарифные категории, если они есть, становятся отдельными слагаемыми. В сумму входят судья, повторы после ошибок и проверяющие агенты. Затраты на инструменты добавляются отдельно.
Для одинакового исходного капитала A и одного периода сравнения:
Δ_net = Δ_PnL_gross − Δ_trading_costs − Δ_compute_and_tools
Δ_net_bps = 10 000 × Δ_net / A
Все величины здесь в одной валюте. Если торговые издержки уже включены в PnL, вычитать их второй раз нельзя. Если задержка обсуждения отражена в более поздней цене исполнения, нельзя еще раз списывать тот же эффект как условный штраф за задержку. При этом долю пропущенных сроков решений стоит показывать отдельно.
Итоговый отчет должен сопоставлять дебаты и независимый ансамбль, затем дебаты и самостоятельную проверку при нескольких заранее заданных бюджетах. Рядом нужны оборот, риск, чистый результат, расход токенов и время ответа. Полезность может состоять в меньшей просадке, но тогда сравнение должно учитывать долю денежных остатков и принятую рыночную экспозицию.
Правило остановки тоже проверяется: например, завершать обсуждение, когда следующий раунд не добавил проверенного факта или исправления. Это кандидат для опыта, а не универсальная рекомендация. Дешевое уточнение расчета может оправдать дополнительный раунд; длинное повторение общего тезиса увеличивает счет без измеренного выигрыша.
Практический первый шаг — сохранить первоначальные ответы и добавить контроль без общения. Если преимущество появляется только относительно одного агента, полезным компонентом может быть ансамбль. Если оно остается относительно самостоятельной проверки при сопоставимых ресурсах и после издержек, появляются основания исследовать вклад дебатов дальше. До такого сравнения пять согласных голосов — характеристика протокола, а не пять независимых доказательств.
Исследования: Huang et al., arXiv:2609.29701v1 — в истории arXiv указана дата 2026-08-31; Zhao et al., arXiv:2610.04686v1 — 2026-10-03; Xia et al., arXiv:2605.19337v2 — обновление 2026-10-04. Версии проверены на 2026-10-08. Иллюстрации концептуальные; таблица голосования — собственный синтетический расчет.
Авторы
Инженер торговых систем
Разработка торговых ботов с 2017 года: межбиржевой арбитраж (подключал до 30 бирж), парный арбитраж на коинтеграции между спотом и фьючерсами, скальпинг, фронтраннинг, торговля по новостям, сентиментный анализ, трендовые алгоритмы, а также алгоритмы управления и балансировки портфелей. Делает выставление ордеров до 1 мс, warehouse для big data, бэктестинг-движки, AI-агентов и интерфейсы для ботов (в т.ч. open-source profitmaker.cc). Стек: JS/TS, Python, Rust/Zig/Go, DevOps, backend, frontend, архитектура.