KI-Trading-Track-Record: So prüfen Sie die Belege
Welche sechs Nachweise einen öffentlichen KI-Trading-Track-Record überprüfbar machen und warum ein Live-Quartal mit Ergebnissen nichts beweist.
Ein KI-Trading-Track-Record ist überprüfbar, wenn eine außenstehende Person ihn anhand von Unterlagen rekonstruieren kann, die bereits vor den Ergebnissen existierten. Nur sehr wenige online veröffentlichte Track-Records erfüllen diese Anforderung. Die folgende Checkliste können Sie in etwa zwei Minuten anwenden. Für vier Punkte stehen Marktdaten zur Verfügung: Benchmark, Zeitstempel, Handelskosten und Stichprobenlänge.
Was macht einen KI-Trading-Track-Record überprüfbar?
Sechs Merkmale. Jedes davon lässt sich anhand konkreter Nachweise prüfen und ist keine Ermessensfrage.
- Einträge, die veröffentlicht wurden, bevor das Ergebnis bekannt war. Der Zeitstempel muss an einer Stelle stehen, die der Autor nicht nachträglich ändern kann, etwa in einem damals eingespielten Commit oder in einer Brokerabrechnung. Eine Datei mit einer Liste vergangener Trades ist eine Behauptung über die Vergangenheit, aber kein zeitnaher Nachweis.
- Ein Benchmark, der zu Beginn genannt und danach nicht geändert wird. „Den Markt schlagen“ sagt nichts aus, solange der Vergleich nicht auf einen bestimmten Fonds und einen bestimmten Zeitraum festgelegt ist.
- Kosten, die in den ausgewiesenen Zahlen enthalten sind. Dazu gehören Provisionen, regulatorische Gebühren, Leihkosten für Short-Positionen und der Spread, der sowohl beim Einstieg als auch beim Ausstieg bezahlt wird.
- Ein versioniertes statt nachträglich bearbeitetes Runbook. Wenn ein öffentliches Repository den Track-Record stützt, sollte der relevante Link auf eine getaggte Version oder einen Commit-Hash verweisen. Ein Link auf den Standard-Branch zeigt die heutige Strategie. Das muss nicht die Strategie sein, die im März gehandelt wurde.
- Jede Position und jedes Konto, einschließlich der Verlierer. Wenn von fünf laufenden Konten nur eines veröffentlicht wird, handelt es sich um eine Auswahl.
- Ausreichend Startkapital, damit die Ausführungen plausibel sind. Ein Nominalwert von einigen hundert Dollar kann Positionen „halten“, die kein echter Auftrag zum angegebenen Preis ausgeführt hätte.
Das Fehlen eines dieser Punkte bedeutet nicht automatisch, dass der Track-Record unehrlich ist. Er ist dann jedoch nicht überprüfbar. Das kommt häufiger vor und ist für den Leser genauso unbrauchbar.
Warum der Benchmark im Voraus festgelegt werden muss
Ein Benchmark, der erst nach Vorliegen der Ergebnisse ausgewählt wird, ist der günstigste Vorteil im Finanzwesen. Sechs breit aufgestellte US-Indexfonds, derselbe Zeitraum von sechs Monaten im Jahr 2026, ausschließlich die Kursveränderung:
Das exakte SQL hinter jeder Zahl
WITH rets AS (
SELECT ticker,
round(100 * (toFloat64(argMax(close, window_start))
/ toFloat64(argMin(close, window_start)) - 1), 2) AS return_pct
FROM global_markets.delayed_stocks_minute_aggs
WHERE ticker IN ('SPY', 'QQQ', 'IWM', 'DIA', 'RSP', 'MDY')
AND toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-01-02')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-06-30')
AND (toHour(toTimeZone(window_start, 'America/New_York')) * 60
+ toMinute(toTimeZone(window_start, 'America/New_York'))) BETWEEN 570 AND 959
GROUP BY ticker
)
SELECT ticker,
return_pct,
round(return_pct - min(return_pct) OVER (), 2) AS points_above_worst
FROM rets
ORDER BY return_pct DESCIWM erzielte 21.12%, während DIA 8.42% erzielte. Zwischen dem besten und dem schlechtesten Fonds im 6 lagen bei identischem Zeitraum 12.7 Punkte. Welcher Fonds nach Ablauf des Zeitraums als Vergleich gewählt wird, entscheidet damit über die gesamte Differenz. Die Strategie muss nichts leisten, um sie zu erhalten. Es handelt sich um Kursrenditen vor Dividenden. Eine zweite wichtige Messregel sollte ebenfalls im Voraus genannt werden (wie Monatsrenditen gemessen werden erläutert die Berechnung der Gesamtrendite).
Warum der Einstiegszeitstempel die gesamte Aussage bestimmt
Ein Einstieg, der erst nach der Kursbewegung erscheint, ist die Beschreibung eines Charts. Die Entfernung, die ein Markt innerhalb einer Sitzung zurücklegt, ist groß genug, dass der Unterschied zwischen „um 09:35 Uhr veröffentlicht“ und „um 15:55 Uhr veröffentlicht“ die meisten behaupteten Vorteile überlagert. Hier ist diese Entfernung, gemessen vom ersten Print jeder Sitzung, für die erste Hälfte des Jahres 2026:
Das exakte SQL hinter jeder Zahl
WITH minute_px AS (
SELECT toDate(toTimeZone(window_start, 'America/New_York')) AS session_date,
toTimeZone(window_start, 'America/New_York') AS et,
toFloat64(close) AS px
FROM global_markets.delayed_stocks_minute_aggs
WHERE ticker = 'SPY'
AND toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-01-02')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-06-30')
AND (toHour(toTimeZone(window_start, 'America/New_York')) * 60
+ toMinute(toTimeZone(window_start, 'America/New_York'))) BETWEEN 570 AND 959
),
opens AS (
SELECT session_date, argMin(px, et) AS open_px
FROM minute_px
GROUP BY session_date
),
buckets AS (
SELECT session_date,
toStartOfInterval(et, INTERVAL 30 MINUTE) AS bucket,
argMax(px, et) AS bucket_px
FROM minute_px
GROUP BY session_date, bucket
)
SELECT formatDateTime(b.bucket, '%H:%i') AS et_time,
count() AS session_count,
round(quantileDeterministic(0.5)(abs(100 * (b.bucket_px / o.open_px - 1)),
cityHash64(b.session_date)), 3) AS median_abs_move_pct
FROM buckets AS b
INNER JOIN opens AS o ON b.session_date = o.session_date
GROUP BY et_time
ORDER BY et_timeIm 09:30-ET-Zeitfenster endete die mittlere Sitzung 0.216% vom Eröffnungskurs entfernt. Im 15:30-Zeitfenster betrug die mittlere Entfernung 0.415%. Alles, was ein Agent zur Eröffnung wusste, schließt fast die gesamte nachfolgende Bewegung aus. Eine Commit-Historie oder ein datierter öffentlicher Feed belegt die zeitliche Reihenfolge (tägliche KI-Marktberichte hängen von derselben Eigenschaft ab). Ein Screenshot einer Equity-Kurve belegt sie nicht.
Was in den Zahlen enthalten sein muss
Bruttorenditen beschreiben ein Portfolio, das niemand hätte halten können. Jeder Einstieg und jeder Ausstieg überquert den Bid-Ask-Spread, also die Differenz zwischen dem besten Kaufpreis und dem besten Verkaufspreis. Diese Differenz ist bei den einzelnen Titeln nicht gleich:
Das exakte SQL hinter jeder Zahl
SELECT ticker,
round(quantileDeterministic(0.5)(20000 * (toFloat64(ask_price) - toFloat64(bid_price))
/ (toFloat64(ask_price) + toFloat64(bid_price)),
cityHash64(sip_timestamp)), 2) AS median_spread_bps,
round(25000 * quantileDeterministic(0.5)(2 * (toFloat64(ask_price) - toFloat64(bid_price))
/ (toFloat64(ask_price) + toFloat64(bid_price)),
cityHash64(sip_timestamp)), 2) AS round_trip_cost_per_25k_usd
FROM global_markets.cache_stocks_quotes
WHERE ticker IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'MSTR')
AND sip_timestamp >= toDateTime('2026-07-15 15:00:00')
AND sip_timestamp < toDateTime('2026-07-15 16:00:00')
AND bid_price > 1
AND ask_price > bid_price
GROUP BY ticker
ORDER BY median_spread_bps DESCIn dieser einen Mittagsstunde lag der mittlere quotierte Spread bei 10.08 Basispunkten für MSTR, verglichen mit 0.27 für SPY. Ein Basispunkt entspricht einem Hundertstel eines Prozentpunkts. Bei einer Position von 25.000 $ kostet das einmalige Überqueren des Spreads in beide Richtungen am breiten Ende dieser Liste $25.2 und am engen Ende $0.66, jeweils vor Provisionen. Ein Portfolio, das einmal pro Woche vollständig umgesetzt wird, zahlt diesen Betrag ungefähr fünfzigmal pro Jahr. Ein Track-Record, der diese Kosten auslässt, schreibt sich diese Dollarbeträge stillschweigend selbst gut (was der Handel einer Aktie kostet erläutert die übrigen Kosten).
Wie lange muss ein Live-Track-Record laufen, bevor Ergebnisse aussagekräftig sind?
Ein Quartal Live-Handel ist eine einzelne Ziehung aus einer breiten Verteilung. Ihre Spannweite lässt sich messen. Für SPY, den größten Fonds zur Nachbildung des S&P 500, wurden seit Januar 2015 alle überlappenden Zeitfenster einer bestimmten Länge in Perzentile eingeteilt:
Das exakte SQL hinter jeder Zahl
WITH daily AS (
SELECT toDate(toTimeZone(window_start, 'America/New_York')) AS session_date,
toFloat64(argMax(close, window_start)) AS close_px
FROM global_markets.delayed_stocks_minute_aggs
WHERE ticker = 'SPY'
AND toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2015-01-02')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-06-30')
AND (toHour(toTimeZone(window_start, 'America/New_York')) * 60
+ toMinute(toTimeZone(window_start, 'America/New_York'))) BETWEEN 570 AND 959
GROUP BY session_date
),
series AS (
SELECT groupArray(close_px) AS px
FROM (SELECT close_px FROM daily ORDER BY session_date)
),
horizons AS (
SELECT arrayJoin([21, 63, 126, 252]) AS sessions, px
FROM series
),
windows AS (
SELECT sessions,
arrayJoin(arrayMap(i -> (i, 100 * (px[i + sessions] / px[i] - 1)),
range(1, length(px) - sessions + 1))) AS w
FROM horizons
),
measured AS (
SELECT sessions,
w.1 AS window_index,
w.2 AS window_return_pct
FROM windows
)
SELECT multiIf(sessions = 21, '1 month',
sessions = 63, '3 months',
sessions = 126, '6 months',
'12 months') AS holding_period,
count() AS window_count,
round(quantileDeterministic(0.05)(window_return_pct,
cityHash64(window_index * 1000 + sessions)), 1) AS p05_return_pct,
round(quantileDeterministic(0.50)(window_return_pct,
cityHash64(window_index * 1000 + sessions)), 1) AS median_return_pct,
round(quantileDeterministic(0.95)(window_return_pct,
cityHash64(window_index * 1000 + sessions)), 1) AS p95_return_pct,
round(quantileDeterministic(0.95)(window_return_pct,
cityHash64(window_index * 1000 + sessions))
- quantileDeterministic(0.05)(window_return_pct,
cityHash64(window_index * 1000 + sessions)), 1) AS spread_pct,
round(stddevSamp(window_return_pct), 1) AS stdev_pct
FROM measured
GROUP BY sessions
ORDER BY sessionsÜber 2826 überlappende Dreimonatszeiträume betrug das mittlere Ergebnis eines reinen Haltens 3.9%. Das 5. Perzentil lag bei -8.8%, das 95. Perzentil bei 12.2%. Die Bandbreite umfasste 21.1 Punkte. Jedes einzelne Quartalsergebnis innerhalb dieser Spanne ist damit vereinbar, dass jemand einfach den Index hielt und in Urlaub fuhr. Startet man zwanzig Agenten, lässt sie ein Quartal laufen und veröffentlicht den besten, stammt die angezeigte Zahl konstruktionsbedingt aus dem oberen Bereich einer solchen Spanne.
Die Berechnung zur erforderlichen Stichprobenlänge ist unerbittlich. Zwölfmonatige Ergebnisse derselben Reihe weisen eine Standardabweichung von 13.6 Punkten auf. Um einen tatsächlichen Vorteil von Zufallsrauschen zu unterscheiden, sind ungefähr (2 × Schwankung ÷ Vorteil)² Jahre mit Live-Ergebnissen erforderlich. Bei dieser Schwankung würde ein hypothetischer Vorteil von drei Punkten pro Jahr viele Jahrzehnte erfordern. Selbst ein Vorteil von zehn Punkten benötigt Jahre statt Monate. Die oben genannten Zeitfenster überlappen. 2826 bezeichnet daher die Anzahl der Zeitfenster und nicht die Zahl unabhängiger Stichproben.
Klären 25.000 $ echtes Geld die Frage?
Echtes Geld verbessert die Aussagekraft der Belege auf eine bestimmte Weise. Paper-Trading wird zu Preisen ausgeführt, denen keine Gegenpartei zugestimmt hat, und eine Order wird dabei nie abgelehnt. Ein mit 25.000 $ finanziertes Konto wird gegen Live-Quotes ausgeführt und zahlt echte Provisionen. Die Abrechnungen kann ein Dritter prüfen. Außerdem sind die Positionsgrößen groß genug, dass die Ausführungen realistisch und nicht nur theoretisch sind.
Das Stichprobenproblem bleibt jedoch bestehen. 25.000 $, die vier Monate lang gehandelt werden, sind weiterhin eine einzelne Ziehung aus der oben beschriebenen Verteilung. Ein Live-Konto kann nach einem Drawdown geschlossen und mit einem neuen Track-Record wieder eröffnet werden. Die Größe macht die Ausführungen glaubwürdig. Erst die Zeit macht die Ergebnisse aussagekräftig.
Vier typische Fehlerquellen
- Ein Backtest im Gewand eines Track-Records. Simulierte Ergebnisse auf Basis vergangener Daten sind Hypothesen über die Vergangenheit. Look-ahead-Bias zeigt, wie eine Simulation Informationen aufnimmt, über die die Strategie zum damaligen Zeitpunkt nicht verfügen konnte. Das deutlichste Warnsignal ist eine Equity-Kurve, die Jahre vor dem Beginn des Codes startet.
- Nur der Überlebende auf der Bühne. Zehn Agenten werden gestartet, einer wird veröffentlicht. Multi-Agent-KI-Trading-Systeme machen dies leicht, auch unbeabsichtigt. Das Framework, das zehn Varianten ausführt, wählt zugleich diejenige aus, über die anschließend berichtet wird.
- Der Neustart. Ein Drawdown, eine Pause, ein neues Konto, eine Kurve, die am Tag des Neustarts beginnt. Die entscheidende Frage lautet: Zeigen Sie die Equity-Kurve ab dem ersten Dollar des ersten Kontos.
- Das nachträglich umgeschriebene Runbook. Prompts und Positionslimits werden zwischen dem Trade und dem Bericht geändert. Von LLMs generierte Alpha-Faktoren lassen sich zu Tausenden erzeugen. Deshalb muss die Auswahlregel vor der Auswahl veröffentlicht werden. Andernfalls wird der Track-Record zu einer Geschichte darüber, welche Faktoren zufällig funktioniert haben.
FAQ
Kann ein KI-Trading-Track-Record überprüft werden?
Ja, wenn die Einträge veröffentlicht wurden, bevor ihre Ergebnisse bekannt waren, der Benchmark im Voraus feststand, die Kosten in den Zahlen enthalten sind und jedes Konto gezeigt wird. Die Prüfung ist mechanisch und dauert nur wenige Minuten. Die meisten veröffentlichten Track-Records scheitern bereits am ersten Punkt.
Wie lange muss ein Live-KI-Trading-Track-Record laufen?
Länger als fast jeder veröffentlichte Track-Record. Die Zwölfmonatsergebnisse des Index wiesen in den hier gemessenen Zeitfenstern eine Standardabweichung von 13.6 Punkten auf. Einen moderaten Vorteil bei einem üblichen Konfidenzniveau von Zufall zu unterscheiden, erfordert daher mindestens mehrere Jahre. Bei einem kleinen Vorteil können Jahrzehnte erforderlich sein.
Reichen 25.000 $ aus, damit die Ergebnisse eines KI-Portfolios aussagekräftig sind?
Sie reichen aus, um die Ausführungen real zu machen: mit Live-Quotes, echten Provisionen und prüfbaren Abrechnungen. Sie reichen nicht aus, um Ergebnisse aus wenigen Monaten statistisch aussagekräftig zu machen. Dafür ist die verstrichene Zeit entscheidend, nicht die Kontogröße.
Was ist der Unterschied zwischen einem Backtest und einem Track-Record?
Ein Backtest wendet Regeln auf bereits vorhandene Daten an. Ein Track-Record ist eine Reihe von Entscheidungen, die vor ihren Ergebnissen veröffentlicht wurden. Nur der zweite kann durch das Geschehen danach widerlegt werden. Das macht ihn zu einem Beleg.
Warum ist die Wahl des Benchmarks so wichtig?
In der ersten Hälfte des Jahres 2026 lagen die sechs oben genannten Indexfonds bei der reinen Kursentwicklung 12.7 Punkte auseinander. Ein Benchmark, der erst nach Ablauf des Zeitraums ausgewählt wird, kann diese gesamte Differenz liefern, ohne dass die Strategie etwas dazu beitragen muss.
Jede Zahl auf dieser Seite stammt aus einer gespeicherten Abfrage von Marktdaten. Die SQL-Abfrage steht unter jedem Panel. Übertragen Sie dieselben Zeitfenster im Strasmore-Terminal auf Ihre eigenen Daten.