Überblick
Eine Sendung durchläuft zehn Stufen. Jede Stufe speichert ihr Ergebnis und kann einzeln wiederholt werden. Wird etwa die Urteilslogik verbessert, lassen sich alle Urteile neu fällen, ohne neu zu transkribieren. Der Fortschritt ist live in der Oberfläche zu sehen, inklusive der Kosten je Stufe.
- 01AbrufVideo, Metadaten, Sendungsseite, Untertitel
- 02TranskriptWort für Wort mit Zeitstempel und Stimmentrennung
- 03RedebeiträgeZusammenhängende Beiträge je Stimme
- 04AbgleichUntertitel der Sender als zweite Quelle
- 05SprecherStimmen werden Namen zugeordnet
- 06ThemenThemen je Beitrag, Framing des Titels
- 07BehauptungenPrüfbare Tatsachenaussagen
- 08FaktencheckRecherche, Urteil, Gewichtung
- 09DebatteStilmittel, Fragen, Reaktionen
- 10StandbilderPorträts und Momente aus dem Video
Transkript
Die Tonspur wird mit einem spezialisierten Spracherkennungsmodell (ElevenLabs Scribe) Wort für Wort transkribiert, jedes Wort mit Start- und Endzeit. So lässt sich jede Aussage im Video sekundengenau anspringen und beim Abspielen mitlesen.
Wo der Sender Untertitel anbietet, dienen sie als zweite, unabhängige Quelle. Beide Texte werden über gemeinsame Wortfolgen aneinander ausgerichtet. In Stichproben war das Transkript genauer als die Untertitel. Die Untertitel liefern dafür oft die Information, wer spricht.
Wer spricht?
Die Spracherkennung trennt Stimmen, kennt aber keine Namen. Die Gäste kommen aus der Sendungsbeschreibung, der Vorstellungsrunde und den Bauchbinden; ein Sprachmodell ordnet Stimmen Namen zu und begründet die Zuordnung.
- Korrektur je Beitrag: Kennzeichnen die Untertitel einen Beitrag eindeutig anders (mindestens 60 % Übereinstimmung, mindestens sechs Wörter), wird dieser Beitrag umgeschrieben. Stimmentrennung irrt besonders bei kurzen Zwischenrufen.
- Zitate: Jede Behauptung wird als eigene Aussage, Zitat oder Wiedergabe eingeordnet. Zitiert die Moderation einen Gast („Herr X sagt, …“), zählt die Behauptung für den Gast, nicht für die Moderation.
- Bilder: Porträts stammen aus der Sendung selbst. Aus vielen Standbildern einer Person wird per Konsens das Bild gewählt, das sie am zuverlässigsten zeigt; unsichere Bilder werden nicht als Porträt verwendet.
Welche Behauptungen geprüft werden
Aus dem Transkript werden überprüfbare Tatsachenbehauptungen herausgelöst: Statistiken, Ursache-Wirkungs-Aussagen, Rechtliches, Historisches, Zitate, Aussagen über die Studienlage und unausgesprochene Prämissen. Meinungen, Forderungen und Prognosen werden nicht geprüft.
Jede Behauptung erhält eine Prüfwürdigkeit zwischen 0 und 1: Wie konkret, wie folgenreich, wie überprüfbar ist sie? Recherchiert wird ab 0,55. Das ist eine bewusste Auswahl: Wer viele konkrete Zahlen nennt oder die zentrale These vertritt, wird öfter geprüft. Registrierte Mitglieder der Redaktion können jede Stelle zusätzlich zur Prüfung markieren.
Recherche in Stufen
Ein Sprachmodell recherchiert jede Behauptung im Netz, bevorzugt in Primärquellen: amtliche Statistik, Gesetzestexte, Studien, Originaldokumente. Die Recherche ist gestuft, damit die meisten Behauptungen günstig bleiben und schwierige die nötige Tiefe bekommen:
| Stufe | Wann | Umfang |
|---|---|---|
| Schnell | jede prüfwürdige Behauptung | bis zu 3 Suchen, 2 Seiten im Volltext |
| Gründlich | wenn die schnelle Recherche nichts Belastbares findet oder unsicher bleibt (< 50 %) | bis zu 6 Suchen, 3 Seiten |
| Tief | auf Anforderung der Redaktion | stärkstes Modell, bis zu 9 Suchen, 5 Seiten |
- Nur echte Quellen: Als Beleg zählen ausschließlich Seiten, die während der Recherche tatsächlich abgerufen wurden. Vom Modell „erinnerte“ Links werden verworfen.
- Bibliothek: Studien und Dokumente, die in einer Sendung erwähnt werden, werden gesammelt und bei späteren Prüfungen wiederverwendet, mit ihren Einschränkungen.
- Sendungskontext: Die Recherche kennt Datum und Thema der Sendung, damit sie den Stand zum Zeitpunkt der Aussage prüft, nicht den von heute.
Wie Urteile entstehen
Das Urteil soll eine faire Redakteurin nachvollziehen und mitgehen können. Deshalb wählt das Modell kein Etikett, sondern liefert nur die Bausteine. Das Urteil berechnet danach eine feste Tabelle.
- Teilaussagen: Die Aussage wird in ihre Teile zerlegt, jeder Teil einzeln geprüft und der Kern markiert, also das, worum es der Person geht. ✓ belegt✓ sinngemäß belegt≈ leicht ungenau↑ zugespitzt⇄ Forschung uneins? nicht prüfbar✗ widerlegt
- Eindruckstest: Was nimmt jemand mit, der nur diesen Satz hört, und stimmt das? Zuspitzung ist in einer Talkshow normal und macht das Bild nicht falsch, solange der Kern trägt.
- Gesprochenes fair lesen: Zitate in freier Rede werden auf ihren Sinn geprüft, auch übersetzte. Die Anführungszeichen stammen aus der Transkription. Umgangssprachliche Rundung („sechzig Prozent“ für 57,7 %) gilt als belegt.
Aus diesen Bausteinen folgt das Urteil. Die erste zutreffende Zeile entscheidet:
| Der Kern ist widerlegt | Falsch |
| Zum Kern geben die Quellen nichts her | Unbelegt |
| Ein Teil des Kerns ist widerlegt | Irreführend |
| Einzelne Teile stimmen, das Bild, das hängen bleibt, ist aber falsch | Irreführend |
| Zum Kern ist die Forschung uneins, eine Lesart wird als gesichert dargestellt | Fehlender Kontext |
| Die Fakten stimmen, ohne fehlenden Kontext entsteht aber ein schiefes Bild | Fehlender Kontext |
| Alle Teile belegt (auch sinngemäß), das Bild stimmt | Richtig |
| Der Kern stimmt, Nebenpunkte oder Details sind ungenau oder zugespitzt | Überwiegend richtig |
Jeder Faktencheck zeigt diese Bausteine: was stimmt, was nicht, was hängen bleibt, und darum welches Urteil.
- Richtig
- Überwiegend richtig
- Fehlender Kontext
- Irreführend
- Falsch
- Unbelegt
Gewichtung
Nicht jede Ungenauigkeit wiegt gleich. Jedes Urteil wird zusätzlich eingeordnet nach Relevanz (Nebensache, relevant, zentral fürs Argument) und Abweichung (keine, gering, deutlich, grob). Umgangssprachliche Rundungen („fast die Hälfte“ bei 46 %) entschuldigen nur geringe Abweichungen. Schwerwiegend ist eine Aussage erst, wenn sie irreführend oder falsch ist, relevant oder zentral fürs Argument und deutlich oder grob daneben liegt.
Unbelegt ist kein verstecktes „falsch“: Findet die Recherche keine belastbaren Quellen, wird kein Urteil über die Aussage gefällt.
Korrekturen
Wird ein Urteil neu gefällt (nach einer Verbesserung der Methode, einer tieferen Recherche oder einem Hinweis), bleibt die frühere Fassung mit Zeitpunkt und Begründung in der Historie der Behauptung sichtbar.
Debatte & Moderation
Neben dem Inhalt wird die Form der Debatte analysiert, mit gleichem Maßstab für alle, die Moderation eingeschlossen. Bewertet wird die Argumentation, nicht die politische Position.
Stilmittel
- Suggestivfrage
- Eine Frage, die die gewünschte Antwort bereits nahelegt.
- Strohmann
- Die Gegenposition wird verzerrt wiedergegeben, um sie leichter anzugreifen.
- Whataboutism
- Ablenkung durch Verweis auf das Fehlverhalten anderer.
- Falsches Dilemma
- Nur zwei Optionen werden zugelassen, obwohl es mehr gibt.
- Ad hominem
- Die Person wird angegriffen statt ihres Arguments.
- Pauschalisierung
- Vom Einzelfall wird unzulässig aufs Ganze geschlossen.
- Zahlentrick
- Zahlen ohne Bezugsgröße, Rosinenpicken oder absolut/relativ vertauscht.
- Angst- oder Empörungsappell
- Gefühle werden angesprochen statt Argumente geliefert.
- Kampfbegriff
- Ein wertender Begriff nimmt die Bewertung vorweg.
- Ausweichen
- Eine konkrete Frage wird erkennbar nicht beantwortet.
Jeder Fund wird mit Zitat, Begründung und Gewicht gespeichert und lässt sich im Video anspringen.
Fragen der Moderation
Jede Frage der Moderation wird eingeordnet als offen, geschlossen, kritisch, suggestiv oder provokant. Daraus ergibt sich, wer welche Art von Fragen bekommt. Mehr kritische Fragen sind nicht per se unfair. Es kommt darauf an, ob alle Seiten gleich behandelt werden.
Unterbrechungen
Als Unterbrechung zählt, wenn ein Beitrag mitten im Satz abbricht und innerhalb von 0,6 Sekunden eine andere Person übernimmt. Werte werden je 10 Minuten Redezeit angegeben, damit Vielredner nicht automatisch vorne liegen.
Umgang mit falschen Aussagen
Für jede falsche oder irreführende Aussage eines Gastes wird geprüft, was danach in der Sendung passiert: widerspricht die Moderation, hakt sie nach, widerspricht ein anderer Gast, oder bleibt die Aussage stehen?
Themen & Framing
Jeder Redebeitrag wird einem oder mehreren Themen aus einer festen, versionierten Liste zugeordnet. Eine feste Liste macht Sendungen und Zeiträume vergleichbar.
- Rente & Alter
- Gesundheit & Pflege
- Steuern, Haushalt & Schulden
- Wirtschaft & Arbeit
- Soziales & Bürgergeld
- Wohnen & Mieten
- Migration & Integration
- Innere Sicherheit & Kriminalität
- Klima & Energie
- Außen- & Verteidigungspolitik
- Parteien, Wahlen & Koalitionen
- Extremismus & Antisemitismus
- Bildung & Familie
- Verkehr & Mobilität
- Digitales & Medien
- Sonstiges
Der Titel einer Sendung wird auf seinen Deutungsrahmen hin gelesen, angelehnt an die Framing-Forschung (Entman; Policy-Frames-Codebuch nach Boydstun u. a.): Welche Themen kündigt er an, in welchem Rahmen, in welchem Ton, mit welcher Art Frage, mit welchen zuspitzenden Begriffen? Anschließend wird verglichen, was angekündigt und was tatsächlich besprochen wurde.
- Kosten & Wirtschaft
- Gerechtigkeit & Fairness
- Sicherheit & Ordnung
- Krise & Bedrohung
- Konflikt & Machtfrage
- Verantwortung & Schuld
- Moral & Werte
- Handlungsfähigkeit & Kompetenz
- Freiheit & Eigentum
- Menschliches Schicksal
Politische Positionen
Ob eine Aussage eher links oder rechts steht, schätzt hier kein Modell nach Gefühl. Redebeiträge der Gäste werden nach dem Codebuch des Manifesto Project (MARPOR) kodiert, dem Schema, mit dem seit den 1980ern Wahlprogramme weltweit verglichen werden. Kodiert wird die Position, die ein Beitrag selbst vertritt (etwa „Marktregulierung“, „Sozialstaat ausbauen“, „Recht & Ordnung“), höchstens zwei Codes je Beitrag. Fragen der Moderation, Zitate und reine Faktenwiedergabe bleiben unkodiert.
- RILE (Laver & Budge): (rechte − linke Aussagen) ÷ alle Aussagen × 100, von −100 bis +100.
- Wirtschaftliche Achse: Saldo aus marktorientierten und staatsorientierten Aussagen, −1 bis +1.
- Gesellschaftliche Achse: Saldo aus traditionell-autoritären und liberal-progressiven Aussagen (angelehnt an GAL–TAN), −1 bis +1.
Gemessen werden Aussagen, nie Menschen. Werte unter zehn kodierten Aussagen werden blass gezeigt. Die automatische Kodierung ist noch nicht gegen eine von Menschen kodierte Stichprobe validiert. Bis dahin sind alle Werte vorläufig. Die Kodierung läuft nicht automatisch, sondern wird je Sendung bewusst gestartet.
Vergleiche & Statistik
- Mindestmengen: Personen werden erst ab 20 geprüften Aussagen und 3 Auftritten verglichen. Darunter werden Einzelbeobachtungen gezeigt, ohne Reihenfolge nach Anteil.
- Unsicherheit: Anteile werden mit 95-%-Konfidenzintervall (Wilson) angegeben. Bei 4 von 20 problematischen Aussagen liegt der wahre Anteil plausibel irgendwo zwischen 8 und 42 %.
- Vollständige Verteilung: Gezeigt wird immer die ganze Urteilsverteilung, kein einzelner Score.
- Moderation getrennt: Moderierende stellen vor allem Fragen; sie werden in der Moderationsbilanz bewertet, nicht im Personenvergleich.
- Raten statt Summen: Stilmittel und Unterbrechungen je 10 Minuten Redezeit.
Grenzen
- Automatisch, nicht redaktionell: Die Urteile werden von Sprachmodellen erzeugt. Sie können irren. Deshalb die Quellen, die Begründung und die Historie an jedem Urteil.
- Auswahl: Geprüft wird eine Stichprobe der prüfwürdigsten Aussagen, nicht jede Aussage. Das bevorzugt konkrete Behauptungen.
- Transkript: Bei Durcheinanderreden und Zwischenrufen sind Wortlaut und Sprecherzuordnung weniger sicher.
- Kleine Datenbasis: Solange wenige Sendungen analysiert sind, sind Vergleiche zwischen Personen, Parteien und Formaten vorläufig.
- Keine Absicht: Ob jemand bewusst täuscht, lässt sich von außen nicht feststellen. Wir bewerten Aussagen, nicht Motive.
Kosten & Transparenz
Jede Analyse kostet Rechenzeit bei Sprach- und Spracherkennungsmodellen; die Kosten jeder Stufe werden je Sendung erfasst. Je Sendung gilt ein Budget von 1,50 $ für Modellaufrufe; einfache Aufgaben erledigt ein kleines Modell, nur die Recherche und das Urteil ein großes. Ergebnisse werden zwischengespeichert, damit nichts doppelt bezahlt wird.
Deshalb startet eine Analyse nicht automatisch: Mitglieder schlagen Sendungen vor und stimmen ab, die Redaktion gibt frei.