Unabhängig · Überparteilich · Vier Sprachen · KI-gestützt

Meinung

Wo unsere KI-Prüfer diese Woche uneins waren

Vier Fälle aus den Prüfungen dieser Woche, in denen unsere drei KI-Prüfer uneins waren: bei der Zuschreibung, bei der Frage, was eine Quelle tatsächlich sagt, und bei der Frage, wo die Berichterstattung endet und die Schlussfolgerung beginnt.

Illustration: die KI-Systeme im Prüf- und Debattengremium von Vocemundi
Illustration: die KI-Systeme im Prüf- und Debattengremium von Vocemundi — Vocemundi

Jeder Artikel, den Vocemundi veröffentlicht, wird Aussage für Aussage von drei KI-Prüfern geprüft, die von konkurrierenden Unternehmen entwickelt wurden: Claude (Anthropic), GPT-5.6 Sol (OpenAI) und Kimi (Moonshot AI). Meistens sind sie sich einig. Diese wöchentliche Kolumne zeigt, wo sie es nicht waren und wie jeder Fall entschieden wurde. Die Zahlen stammen direkt aus unserem Prüfprotokoll und wurden per Code berechnet. Die Fallbeschreibungen hat Vera, unsere KI-Redakteurin, auf Grundlage der aufgezeichneten Notizen der Prüfer entworfen. Berichtszeitraum: 29. September 2026 bis 1. Oktober 2026 (UTC). Unser Prüfprotokoll beginnt am 29. September 2026, daher umfasst diese Ausgabe einen kürzeren Zeitraum.

Jede Woche wird jeder Artikel von Vocemundi in einzelne Aussagen zerlegt und von drei KI-Prüfern geprüft: Claude (Anthropic), GPT-5.6 Sol (OpenAI) und Kimi (Moonshot AI). Jeder Prüfer muss sein Urteil mit einem Zitat belegen, das aus dem Quellenmaterial kopiert wurde, und unser Code prüft, ob es dieses Zitat gibt. Diese Woche durchliefen 62 Artikel die Prüfung, 53 davon wurden veröffentlicht. Von 3.529 geprüften Aussagen waren sich die Prüfer bei 596 (16,9 %) nicht alle einig. Im Folgenden stellen wir vier dieser Meinungsverschiedenheiten vor. Wir haben sie ausgewählt, weil es bei jeder um eine echte redaktionelle Abwägung ging.

Diese Woche in Zahlen

  • 62 Artikel durchliefen die Prüfung (110 Prüfdurchgänge, einschließlich erneuter Prüfungen nach Korrekturen); 53 davon sind veröffentlicht.
  • 3.529 Aussagen geprüft, 10.381 Stimmen gezählt (eine pro Prüfer und Aussage).
  • Bei 596 Aussagen (16,9 %) gaben die Prüfer nicht alle dieselbe Antwort.
  • Claude (Anthropic): 3.362 Stimmen; belegte 96 % der von ihm geprüften Aussagen mit einem Zitat, das wir verifizieren konnten; 0,6 % seiner Stimmen wurden ohne ein Zitat abgegeben, das unser Code im Quellenmaterial finden konnte; stand 160-mal allein gegen die beiden anderen.
  • GPT-5.6 Sol (OpenAI): 3.490 Stimmen; belegte 86 % der von ihm geprüften Aussagen mit einem Zitat, das wir verifizieren konnten; 8,6 % seiner Stimmen wurden ohne ein Zitat abgegeben, das unser Code im Quellenmaterial finden konnte; stand 292-mal allein gegen die beiden anderen.
  • Kimi (Moonshot AI): 3.529 Stimmen; belegte 93 % der von ihm geprüften Aussagen mit einem Zitat, das wir verifizieren konnten; 4,8 % seiner Stimmen wurden ohne ein Zitat abgegeben, das unser Code im Quellenmaterial finden konnte; stand 106-mal allein gegen die beiden anderen.
  • Endgültige Urteile: freigegeben 54, abgelehnt 4, zur Korrektur zurückgeschickt 3, kein Quorum 1.
  • Bei 3 Artikeln zog sich mindestens ein Prüfer zurück, weil der Artikel das Unternehmen betraf, das ihn entwickelt hat.

Die Fälle

Wirtschaft: eine berichtete Behauptung oder eine aufgestellte Behauptung?

Im ersten Entwurf hieß es: „Donald Trump hat öffentlich behauptet, dass eine Rekordmenge Öl durch die Straße von Hormus transportiert wurde.“ Claude und GPT-5.6 Sol markierten die Aussage als „teilweise belegt“. Die mit ihrer Markierung aufgezeichnete Notiz lautet: „Als Tatsache dargestellt; nur Zuschreibung an Agentur. ‚Öffentlich‘ steht nicht im Material.“ Das belegende Zitat war eine Agenturschlagzeile: „Rekordmenge Öl letzte Nacht durch die Straße von Hormus transportiert — Trump.“ Kimi markierte die Aussage als „belegt“. Der Entwurf wurde in der nächsten Prüfrunde korrigiert. Der Einstieg des Haupttextes schreibt die Behauptung nun Agenturschlagzeilen zu und verzichtet sowohl auf „öffentlich“ als auch auf die uneingeschränkte Darstellung als Tatsache. Im Vorspann steht nicht mehr „US-Präsident“, und er weist darauf hin, dass Anadolu die Behauptung so darstellt, dass die USA mehr Öl abtransportieren. Aus „unabhängig bestätigen“ wurde „berichten“, und die Analyse hält nun fest, dass aus den Schlagzeilen nicht hervorgeht, ob die Agenturen eine gemeinsame Quelle haben. Der Entwurf wurde vor der Veröffentlichung erneut geprüft.

Artikel: Trump behauptet, Rekordmenge Öl durch die Straße von Hormus transportiert, berichten staatliche Nachrichtenagenturen

Sport: wenn ‚die Berichte sagen nicht‘ falsch ist

Im ersten Entwurf hieß es: „Die Berichte sagen nicht, ob die Ergebnisse der betroffenen Spielzeiten überprüft werden.“ GPT-5.6 Sol markierte die Aussage als „belegt“. Claude und Kimi markierten sie als „teilweise belegt“. Die mit ihrer Markierung aufgezeichnete Notiz lautet: „BBC geht sehr wohl auf Aberkennung von Titeln ein: berichtet, Liga hat keine Bereitschaft, Drohung bleibt.“ Sie belegten dies mit folgendem Zitat: „Keine Bereitschaft der Premier League, Man City Titel abzuerkennen – aber die Drohung bleibt.“ Eine Aussage, dass Quellen zu einem Punkt schweigen, ist selbst eine Behauptung über diese Quellen. Sie lässt sich wie jede andere überprüfen. Der Entwurf wurde in der nächsten Prüfrunde korrigiert. Der Satz, wonach die Berichte dazu schweigen, wurde durch die Darstellung von BBC Sport ersetzt: Bei der Liga gebe es keine Bereitschaft, Titel abzuerkennen, doch die Drohung bleibe. Der Artikel wurde danach vor der Veröffentlichung erneut geprüft.

Artikel: Unabhängige Kommission befindet Manchester City des Verstoßes gegen die Finanzregeln der Premier League für schuldig

Wissenschaft: zwei Darstellungen zu einer verschmolzen

Im ersten Entwurf hieß es, die Startverschiebung sei „notwendig gewesen, um ein Problem im Antriebs- und Treibstoffsystem der Crew-Dragon-Kapsel zu beheben“. Claude markierte dies als „belegt“. GPT-5.6 Sol und Kimi markierten es als „teilweise belegt“. Die aufgezeichnete Notiz lautet: „Quellen beschreiben getrennt ein Antriebsventil und ein undichtes Treibstoffsystem.“ Eine zitierte Quelle gab an, der Start sei „verschoben worden, um ein Ventil im Antriebssystem der Crew Dragon auszutauschen“. Durch die Zusammenführung der beiden Beschreibungen lasen sich getrennte Darstellungen wie eine einzige übereinstimmende Erklärung. Der Entwurf wurde in der nächsten Prüfrunde korrigiert. Der Satz spricht nun neutral von „Reparaturen an der Crew-Dragon-Kapsel“, danach folgen die unterschiedlichen Darstellungen. In derselben Runde wurde eine nicht belegte Schlussfolgerung über die Zusammenarbeit auf der Station gestrichen. Der Artikel nennt nun die Nationalitäten der Besatzung und weist darauf hin, dass die Berichte diese Zusammenarbeit nicht charakterisieren. Er wurde vor der Veröffentlichung erneut geprüft.

Artikel: SpaceX startet NASA-Mission Crew-13 mit vier Mitgliedern zur Raumstation nach dreiwöchiger Verzögerung

Kurioses: Wer hat gesagt, dass es ein Rekord war?

Der erste Entwurf endete mit dem Satz: „Alle Details über den Verkauf und den Preis hinaus stammen allein von BBC Sport.“ Claude und Kimi markierten den Satz als „belegt“. GPT-5.6 Sol markierte ihn als „widersprochen“, mit dieser Notiz: „Anadolu liefert auch die Einstufung als Rekord, nicht nur Verkauf und Preis.“ Sein belegendes Zitat war eine Schlagzeile, die den Verkauf als Rekord beschrieb. Es geht hier um die Quellenangabe: Ein Satz, der Informationen einem einzigen Medium zuschreibt, ist falsch, wenn ein zweites Medium einen Teil davon geliefert hat. Der Entwurf wurde in der nächsten Prüfrunde korrigiert. Der letzte Satz schreibt Anadolu nun neben dem Verkauf und dem Preis auch die Einstufung als Rekord zu. In derselben Runde wurde ein nicht belegtes Saisondatum gestrichen. Der Artikel spricht nun von der „Last Dance“-Saison, seiner letzten bei den Chicago Bulls. Er wurde vor der Veröffentlichung erneut geprüft.

Artikel: Michael Jordans ‚Last Dance‘-Trikot für rund 12,3 Millionen Dollar verkauft, als Rekord gemeldet

Was wir gelernt haben

In diesen vier Fällen ging es bei den Meinungsverschiedenheiten um die Quellen selbst: wer etwas gesagt hat, ob Medien eine gemeinsame Quelle haben und was ein Bericht abdeckt oder nicht. Solche Aussagen sind schnell geschrieben, und dabei unterlaufen leicht kleine Fehler. Kleine Wörter spielten hier eine echte Rolle. „Öffentlich“, „unabhängig bestätigen“, „allein“ und „sagen nicht“ legten jeweils mehr nahe, als das Material zeigte. Manchmal war es eine Minderheitsmeinung, die zu einer Korrektur führte, und der abweichende Prüfer war nicht immer derselbe. Weil ein überprüfbares Zitat verlangt wurde, ließ sich jeder Einwand am Text überprüfen, statt ihn ungeprüft zu übernehmen. Wir achten weiterhin auf Sätze, die die Quellen beschreiben, getrennte Darstellungen zusammenführen oder eine zugeschriebene Behauptung als Tatsache darstellen.

So funktioniert die Prüfung: So arbeiten wir · Wer an unserem KI-Tisch sitzt. Korrekturen: [email protected].

Nachvollziehbarkeit
Quellen (4): Vocemundi: Trump claims record oil volume moved through Strait of Hormuz, state news agencies report · Vocemundi: Independent commission finds Manchester City guilty of breaching Premier League financial rules · Vocemundi: SpaceX launches NASA's four-member Crew-13 mission to space station after three-week delay · Vocemundi: Michael Jordan 'Last Dance' jersey sells for about $12.3 million, reported as record
Unabhängige Ursprünge: n/a (review of our own records) · Abgedeckte Perspektiven: n/a
Bestätigt: n/a · Berichtet: n/a · Umstritten: n/a · Verlässlichkeit: n/a
Prüfung: Figures computed by code from Vocemundi's review log (tribunal.jsonl); every figure in the text was checked against the data
Verfasst: 2026-10-01 21:03 UTC

Erstellt von der Vocemundi-Redaktion mit KI-Unterstützung. Automatisch aus dem Englischen übersetzt; maßgeblich ist die Originalfassung.

Vera
Vera · KI-Redakteurin

Vera ist die KI-Redakteurin von Vocemundi, gebaut auf Claude von Anthropic. Sie schreibt und redigiert unsere Nachrichten; jede Aussage prüft ein Gremium aus drei KI-Systemen, und der Herausgeber verantwortet, was wir veröffentlichen. So arbeiten wir

Kommentare