Multi-Agenten-KI-Handelssysteme Realität
Multi-Agenten-KI-Handelssysteme setzen LLM-Komitees für Trades ein. Architektur, Marktkosten bei Signalausführung und Backtest-Fallen werden analysiert.
Ein Multi-Agenten-KI-Handelssystem verteilt eine Handelsentscheidung auf mehrere große Sprachmodell-Instanzen, weist jeder Instanz eine Rolle zu und fasst ihre Ausgaben zu einem einzigen Auftrag zusammen. Die übliche Besetzung besteht aus einem Nachrichtenleser, einem Fundamentalanalysten, einem Chartanalysten, einem Risikoprüfer und einem Manager-Agenten, der vermittelt. Stand Juli 2026 befinden sich mehrere Open-Source-Frameworks dieser Art im Thema Algorithmischer Handel auf GitHub, jedes mit einigen hundert Sternen. Diese Seite erläutert die Architektur, trennt die veröffentlichten Belege von den README-Behauptungen und legt Marktdaten zu den Kosten vor, die jede Version dieses Systems decken muss.
Was ein Multi-Agenten-KI-Handelssystem tatsächlich ist
Die Architektur ist ein Ausschuss mit einem Vorsitzenden. Jeder Agent besteht aus einer Prompt-Vorlage, einem Datenfeed und einem Ausgabeschema. Der Nachrichtenagent erhält Schlagzeilen und gibt ein Label zurück. Der Fundamentalagent erhält Auszüge aus Einreichungen und gibt eine Bewertung zurück. Der Vorsitzende erhält diese Labels und Bewertungen und gibt einen Auftrag zurück.
Aus diesem Design ergeben sich drei Eigenschaften, die vor jeder Leistungsbehauptung genannt werden sollten.
Jeder Agent verwendet normalerweise ein gemeinsames Basismodell. Fünf Prompts mit denselben Gewichtungen erzeugen korrelierte Meinungen, daher ist eine Fünf-Agenten-Abstimmung keine fünf unabhängigen Schätzungen. Die Ausschuss-Rahmung suggeriert eine Diversifikation, die die Implementierung nicht bietet.
Das System ist eine Text-Pipeline, die um eine numerische Entscheidung herum aufgebaut ist. Das Modell liest Wörter und gibt ein Token aus. Positionsgrößenbestimmung, Auftragstyp, Stop-Platzierung und Exit-Logik sind gewöhnlicher Code darunter, und der Großteil dessen, was das Ergebnis bestimmt, befindet sich in diesem Code und nicht in den Prompts.
Ein Ausschuss-Durchlauf dauert Sekunden. Das ist für ein wöchentliches Rebalancing praktikabel und für Intraday-Geschwindigkeit irrelevant, wo Market Maker in Mikrosekunden quoten und requoten.
Was die Forschung stützt und was nicht
Veröffentlichte Arbeiten zu Sprachmodellen im Finanzwesen lassen sich in drei Behauptungen mit sehr unterschiedlicher Stärke unterteilen.
Extraktion und Klassifikation ist die starke Behauptung. Modelle labeln Stimmungen, extrahieren Zahlen aus Einreichungen und komprimieren lange Dokumente mit einer Genauigkeit, die vor einigen Jahren ein maßgeschneidertes Modell erforderte. Es ist an zurückgehaltenen Texten messbar und hält stand.
Beschreibung des Marktzustands ist die gemischte Behauptung. Modelle verfassen flüssige Darstellungen eines Regimes, und diese Darstellungen sind in der Regel konsistent mit den Daten, die dem Modell gezeigt wurden. Ob die Beschreibung Informationen enthält, die der Preis nicht bereits enthält, ist eine separate Frage, und die Arbeiten, die dies sorgfältig testen, berichten von kleinen Effekten mit breiten Fehlerbalken.
Rentabilität ist die schwache Behauptung. Die meisten Repository-READMEs berichten über einen Backtest und nicht über eine finanzierte Erfolgsbilanz, und die Distanz zwischen einer In-Sample-Eigenkapitalkurve und einem Live-Konto ist die älteste Distanz im quantitativen Handel. Ein Sprachmodell in die Schleife einzubringen, verkürzt sie nicht.
Die Kostenuntergrenze, die ein Signal überwinden muss
Jeder Trade überbrückt einen Spread, und diese Überbrückung ist die Untergrenze, die eine Strategie überwinden muss, bevor alles andere zählt. Mittlerer quotierter Spread während der regulären Handelszeiten, 22. bis 26. Juni 2026, für sechs in den USA notierte Namen:
Das exakte SQL hinter jeder Zahl
SELECT ticker,
round(quantileExactIf(0.5)(toFloat64(ask_price - bid_price) / (toFloat64(ask_price + bid_price) / 2), bid_price > 0 AND ask_price > bid_price) * 10000, 2) AS spread_bps,
round(2 * quantileExactIf(0.5)(toFloat64(ask_price - bid_price) / (toFloat64(ask_price + bid_price) / 2), bid_price > 0 AND ask_price > bid_price) * 10000, 2) AS round_trip_bps,
round(count() / 1e6, 1) AS quote_updates_m
FROM global_markets.cache_stocks_quotes
WHERE ticker IN ('SPY', 'AAPL', 'MSFT', 'KO', 'F', 'RIOT')
AND sip_timestamp >= toDateTime('2026-06-22 00:00:00')
AND sip_timestamp < toDateTime('2026-06-27 00:00:00')
AND (toHour(sip_timestamp) * 60 + toMinute(sip_timestamp)) BETWEEN 810 AND 1199
GROUP BY ticker
HAVING countIf(bid_price > 0 AND ask_price > bid_price) > 0
ORDER BY spread_bpsEin Basispunkt ist ein Hundertstel eines Prozentpunkts. Der engste Name im Panel, SPY, quotierte in dieser Woche einen mittleren Spread von 0.27 Basispunkten. Der breiteste, RIOT, quotierte 7.09. Ein Round Trip zahlt den Spread zweimal, daher beginnt ein Einstieg und Ausstieg beim ersten Namen mit 0.55 Basispunkten Rückstand und das gleiche Paar beim letzten Namen mit 14.19 Basispunkten Rückstand. Ein Agent, der sein Buch zweimal pro Woche umschlägt, zahlt diese Gebühr etwa hundertmal im Jahr, und die Gebühr wird erhoben, unabhängig davon, ob der Aufruf richtig oder falsch war. Was es kostet, eine Aktie zu handeln listet den Rest der Rechnung auf.
Das Rauschen, das ein Richtungsaufruf übertreffen muss
Richtungsaufrufe werden anhand einer Verteilung bewertet, die größtenteils aus kleinen Zahlen besteht. Jede SPY-Sitzung im Kalenderjahr 2025, sortiert nach der Größe ihrer Close-to-Close-Bewegung:
Das exakte SQL hinter jeder Zahl
WITH daily AS (
SELECT toDate(toTimeZone(window_start, 'America/New_York')) AS d,
argMax(close, window_start) AS close_px
FROM global_markets.delayed_stocks_minute_aggs
WHERE ticker = 'SPY'
AND toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2025-01-01')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2025-12-31')
AND (toHour(toTimeZone(window_start, 'America/New_York')) * 60
+ toMinute(toTimeZone(window_start, 'America/New_York'))) BETWEEN 570 AND 959
GROUP BY d
),
paired AS (
SELECT d, close_px,
any(close_px) OVER (ORDER BY d ASC ROWS BETWEEN 1 PRECEDING AND 1 PRECEDING) AS prev_px
FROM daily
),
rets AS (
SELECT d, round(100 * (toFloat64(close_px) / toFloat64(prev_px) - 1), 3) AS ret_pct
FROM paired
WHERE prev_px > 0
)
SELECT multiIf(abs(ret_pct) < 0.25, 'under 0.25%',
abs(ret_pct) < 0.5, '0.25 to 0.5%',
abs(ret_pct) < 1.0, '0.5 to 1%',
abs(ret_pct) < 2.0, '1 to 2%',
'2% and up') AS move_bucket,
count() AS sessions,
round(100 * count() / sum(count()) OVER (), 1) AS pct_of_sessions
FROM rets
GROUP BY move_bucket
ORDER BY min(abs(ret_pct))Die Hälfte des Jahres lag innerhalb eines halben Prozents. Das under 0.25%-Band enthielt 24.9% der Sitzungen und das 0.25 to 0.5%-Band weitere 24.1%. Am anderen Ende bewegten sich 13 Sitzungen um 2% and up, 5.2% des Jahres.
Halten Sie dies neben das Spread-Panel. Ein Basispunkt ist 0,01%. Eine typische Sitzungsbewegung von 0,3% ist das Dreißigfache eines engen Spreads und etwa das Vierfache des breiten. Die Arithmetik lässt Raum für einen geduldigen, korrekten Aufruf und sehr wenig für einen schnellen, marginalen.
Wo das handelbare Universum tatsächlich liegt
Agenten-Frameworks bewerben Abdeckung, oft Hunderte von Ticker-Symbolen, die jeden Morgen gescannt werden. Das Dollarvolumen zeigt, wie viel von dieser Liste Größe absorbieren kann. Jeder in den USA notierte Name, der am 30. Juni 2026 während der regulären Handelszeiten gehandelt wurde, gruppiert nach seinem Rang im Dollarvolumen dieser Sitzung:
Das exakte SQL hinter jeder Zahl
WITH tv AS (
SELECT ticker,
sum(toFloat64(close) * toFloat64(volume)) AS dollar_volume
FROM global_markets.delayed_stocks_minute_aggs
WHERE toDate(toTimeZone(window_start, 'America/New_York')) = toDate('2026-06-30')
AND (toHour(toTimeZone(window_start, 'America/New_York')) * 60
+ toMinute(toTimeZone(window_start, 'America/New_York'))) BETWEEN 570 AND 959
GROUP BY ticker
HAVING sum(toFloat64(close) * toFloat64(volume)) > 0
),
ranked AS (
SELECT ticker, dollar_volume,
row_number() OVER (ORDER BY dollar_volume DESC) AS rk
FROM tv
)
SELECT multiIf(rk <= 10, 'top 10 names',
rk <= 50, 'ranks 11 to 50',
rk <= 200, 'ranks 51 to 200',
rk <= 1000, 'ranks 201 to 1000',
'ranks beyond 1000') AS liquidity_tier,
count() AS tickers,
round(sum(dollar_volume) / 1e9, 2) AS dollar_volume_bn,
round(100 * sum(dollar_volume) / (SELECT sum(dollar_volume) FROM tv), 1) AS pct_of_dollar_volume
FROM ranked
GROUP BY liquidity_tier
ORDER BY min(rk)Zehn Namen trugen 22.5% des Dollarvolumens der Sitzung, etwa 205.04 Milliarden Dollar. Die nächsten 40 trugen 20.5%. Am anderen Ende teilten sich 10966 Namen, die jenseits von 1000 rangierten, 12.9% zwischen ihnen, etwa 117.83 Milliarden Dollar, verteilt über den gesamten Schwanz.
Breite ist billig zu bewerben und teuer zu handeln. Ein Ausschuss, der dreitausend Namen bewertet, verbringt den Großteil seiner Bewertungsarbeit in diesem Schwanz, wo das obige Spread-Panel eine echte Kosten und kein Rundungsfehler ist.
Warum diese Backtests das System schönrechnen
Die größte Einzelquelle eines schönrechnenden Backtests ist die Wahl des Zeitfensters. SPY nach Kalenderjahr, 2016 bis 2025, mit der Lücke zwischen dem höchsten und niedrigsten Schlusskurs des Jahres:
Das exakte SQL hinter jeder Zahl
WITH daily AS (
SELECT toDate(toTimeZone(window_start, 'America/New_York')) AS d,
argMax(close, window_start) AS close_px
FROM global_markets.delayed_stocks_minute_aggs
WHERE ticker = 'SPY'
AND toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2016-01-01')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2025-12-31')
AND (toHour(toTimeZone(window_start, 'America/New_York')) * 60
+ toMinute(toTimeZone(window_start, 'America/New_York'))) BETWEEN 570 AND 959
GROUP BY d
),
yr AS (
SELECT toYear(d) AS year,
argMin(close_px, d) AS first_close,
argMax(close_px, d) AS last_close,
max(close_px) AS high_close,
min(close_px) AS low_close,
count() AS sessions
FROM daily
GROUP BY year
)
SELECT year,
sessions,
round(100 * (toFloat64(last_close) / toFloat64(first_close) - 1), 1) AS price_return_pct,
round(100 * (toFloat64(high_close) / toFloat64(low_close) - 1), 1) AS high_low_range_pct
FROM yr
ORDER BY yearEin System, das nur auf 2021 getestet wurde, einem Jahr, das 28.7% höher schloss, erbt ein steigendes Band. Das gleiche System, das nur auf 2022 getestet wurde, das -20% schloss, erbt ein fallendes. Die innerjährliche Lücke zwischen dem höchsten und niedrigsten Schlusskurs erreichte 68% in 2020 und blieb selbst in den ruhigeren Jahren über 25.3%.
Vier Fallen sitzen zusätzlich zum Zeitfensterproblem, und eine davon gehört allein den Sprachmodellen.
- Vorausschau durch Trainingsdaten. Ein Modell, das auf Texten bis 2025 trainiert wurde, hat bereits gelesen, wie ein Trade aus dem Jahr 2023 ausgegangen ist. Ein Backtest über 2023 stellt eine Frage, auf die das Modell die Antwort kennt, und kein Mischen der Preisserie entfernt dieses Wissen.
- Überlebensverzerrung in der Ticker-Liste. Ein Universum, das aus den heutigen Listings zusammengestellt wird, lässt die Namen weg, die auf dem Weg dorthin delisted wurden.
- Fill-Annahmen. Ein Backtest, der jeden Auftrag zum Mittelkurs füllt, löscht das gesamte obige Kostenpanel aus.
- Selektion über Prompt-Varianten. Zwanzig versuchte Prompt-Formulierungen und die beste gemeldete ist die gleiche Überanpassung, die Parametersweeps lange vor Sprachmodellen geplagt hat.
Wo Sprachmodell-Agenten plausibel helfen
Die ehrliche Version des Pitch ist enger als die README-Version und dennoch nützlich.
Lesegeschwindigkeit ist der klarste Gewinn. Ein Agent, der jede Einreichung und Schlagzeile auf einer Watchlist über Nacht durcharbeitet und eine strukturierte Zusammenfassung zurückgibt, spart Stunden menschlicher Aufmerksamkeit, und die Ausgabe ist gegen die Quelle überprüfbar.
Beschreibung eines Regimes in einfacher Sprache ist der zweite. Ein täglicher Absatz zu Dispersion, Breite und Volatilität, generiert aus denselben Zahlen, die ein Mensch lesen würde, ist ein nützliches Briefing-Dokument, selbst wenn es keine Prognose enthält.
Prozesshygiene ist der dritte. Ein Agent, der einen Auftrag ablehnt, der eine angegebene Positionsgrenze verletzt, oder der eine Strategie markiert, die im Begriff ist, einen Gewinntag zu handeln, setzt Regeln durch, die ein abgelenkter Mensch überspringt.
Keiner dieser drei Punkte ist ein Vorteil im Markt. Alle drei sind Forschungs- und Betriebsarbeit, wo die messbaren Gewinne heute liegen. Ein dokumentierter Effekt wie die Low-Volatility-Anomalie benötigte große Stichproben und wiederholte Out-of-Sample-Replikation, bevor jemand ihn als real behandelte, und ein neues Agenten-Framework muss dieselbe Hürde nehmen oder es räumt sie nicht. Die besten Tage verpassen zeigt, was häufiges Umschichten einen langfristigen Halter kostet.
Die Disziplin, die Praktiker beschreiben
Teams, die diese Systeme öffentlich betreiben, neigen dazu, dieselbe Abfolge zu beschreiben. Vorwärtstest mit simulierten Fills über Monate statt Tage, da eine Papieraufzeichnung nur mit der Geschwindigkeit der Echtzeit wächst. Halten Sie einen Out-of-Sample-Abschnitt zurück, den die Prompts nie gesehen haben. Protokollieren Sie jeden Prompt, jede Antwort und jeden Auftrag, da ein Ausschuss, der nicht wiederholt werden kann, nicht debuggt werden kann. Dimensionieren Sie Positionen mit festen Regeln, die außerhalb des Modells liegen. Zählen Sie jede Kosten aus den obigen Panels, bevor Sie einen Zeitraum als profitabel bezeichnen.
FAQ
Verdienen Multi-Agenten-KI-Handelssysteme tatsächlich Geld?
Die öffentliche Evidenz ist dünn. Die meisten Open-Source-Projekte veröffentlichen einen Backtest und keine geprüfte Live-Aufzeichnung, und Backtests von Sprachmodell-Strategien tragen einen spezifischen Fehler: Das Modell wurde auf Texten trainiert, die den Testzeitraum beschreiben. Eine nicht geprüfte Eigenkapitalkurve demonstriert die Software, nicht einen Vorteil.
Ist ein Ausschuss von LLM-Agenten besser als ein einzelnes Modell?
Ein Ausschuss reduziert einige Formatierungs- und Parsing-Fehler und verleiht der Ausgabe Struktur. Er fügt keine unabhängigen Informationen hinzu, wenn jeder Agent dasselbe Basismodell über denselben zugrundeliegenden Daten abfragt. Fünf korrelierte Meinungen stimmen in etwa wie eine Meinung, mit zusätzlicher Latenz und zusätzlichen Token-Kosten.
Kann ein KI-Agent schneller handeln als ein Market Maker?
Nein. Ein Sprachmodell-Durchlauf dauert Sekunden, während professionelle Quotierungssysteme in Mikrosekunden über ko-lokalisierte Hardware arbeiten. Jede Strategie, deren Gewinn von Geschwindigkeit abhängt, liegt außerhalb dessen, was diese Systeme leisten können, was Horizonte von Tagen und Wochen als plausibles Terrain lässt.
Was ist die größte Backtest-Falle, die spezifisch für LLM-Handelsagenten ist?
Trainingsdaten-Vorausschau. Konventionelle Backtests schützen davor, dass zukünftige Preise in eine Entscheidung einfließen, aber die Gewichte eines Modells kodieren bereits veröffentlichte Kommentare zum Testfenster. Walk-Forward-Fenster und Out-of-Sample-Splits entfernen kein Wissen, das in den Gewichten eingebacken ist, und der einzige saubere Test ist ein Zeitraum nach dem Trainings-Cutoff.
Wie lange muss ein Paper-Trading-Zeitraum laufen?
Der nützliche Rahmen ist die Stichprobengröße und nicht die Kalenderlänge. Eine Strategie, die wöchentlich handelt, produziert etwa fünfzig Beobachtungen pro Jahr, eine kleine Stichprobe für jede Behauptung über einen Vorteil. Praktiker wollen im Allgemeinen genug Trades, um einen Drawdown gesehen zu haben, nicht nur einen guten Zeitraum.
Jedes Panel auf dieser Seite ist eine gespeicherte, versionierte Abfrage über reale US-Marktdaten. Öffnen Sie ein beliebiges Panel, um das SQL dahinter zu lesen, oder führen Sie Ihre eigene Abfrage gegen dieselben Tabellen auf dem Strasmore-Terminal durch.