Wie man ein Video (Ton & Untertitel) mit Claude Code oder Codex übersetzt
Ich nutze KI hauptsächlich für meine Übersetzungsprojekte. Auf YouTube, TikTok oder Facebook finden sich viele chinesische Videos, die weder automatische Untertitel noch eine automatische Übersetzung bieten.
Da ich sie verstehen möchte, habe ich ein Projekt erstellt, das einen großen Teil des Prozesses automatisieren kann: das Video transkribieren, die Untertitel übersetzen und bei Bedarf bis zur automatischen Synchronisation auf Französisch gehen.
Auf derselben Basis lassen sich auch automatisch erstellen: Clips, also kurze Ausschnitte aus dem Video.
In diesem Artikel nehme ich als Beispiel die Übersetzung Chinesisch → Französisch. Aber das Prinzip lässt sich auf praktisch alle Sprachen übertragen. Ich empfehle Ihnen sehr, Claude Code oder Codex CLI – auf der Kommandozeile.
Warum die Transkription statt der OCR verwenden?
Chinesische Videos haben oft chinesische Untertitel direkt ins Bild eingebrannt. Man könnte also OCR (Texterkennung in einem Bild) verwenden, um diese Untertitel zu erfassen.
Nach mehreren Versuchen habe ich jedoch festgestellt, dass diese Methode recht langwierig und kompliziert war. Letztlich ist es einfacher, direkt von der im Video vorhandenen Sprache auszugehen und sie mithilfe eines automatischen Transkriptionssystems namens ASR (Automatic Speech Recognition).
in Text umzuwandeln. Das Prinzip ist also recht einfach:
Video → chinesische Transkription → Korrektur → französische Übersetzung → französische Untertitel → eventuell Synchronisation
Den Skill vorbereiten
Um diesen Prozess zu automatisieren, empfehle ich, vorab einige Referenzdateien im Skillvorzubereiten. Sie enthalten die Regeln, die die Agenten befolgen müssen. So lässt sich das Verhalten des Systems leicht anpassen, ohne den gesamten Workflow neu schreiben zu müssen.
references/
├── translation_rules.md # Übersetzungsregeln
├── glossary_zh_fr.md # Eigennamen und wiederkehrende Begriffe
├── formatting_rules.md # Anzeigeregeln für Untertitel
└── quality_check.md # Qualitätskontrollen
Diese Dateien können mit Hilfe der KI vorbereitet werden. Ich empfehle einfach, sie zu bitten, mehrere Varianten oder einige Übersetzungsbeispiele vorzuschlagen, und dann den Ton und die Regeln auszuwählen, die Ihnen gefallen.
Um die Hauptsession nicht mit dem Text des gesamten Videos zu überlasten, kann der Workflow anschließend autonome Agentenverwenden. Jeder Agent erhält nur die Informationen und Referenzdateien, die er benötigt. So kann sich beispielsweise ein Agent um die Transkription kümmern, ein anderer um die Übersetzung und ein weiterer um die Qualitätskontrolle. Die Hauptsession dient vor allem dazu, die verschiedenen Schritte zu orchestrieren.
Der vollständige Prozess
1. Chinesische Sprache in Untertitel umwandeln
Zunächst wird das Originalvideo beschafft. Für YouTube, Facebook oder TikTok kann man yt-dlp.
verwenden. Anschließend wird ein Spracherkennungssystem (ASR) eingesetzt, um die chinesische Sprache in Text umzuwandeln. Das Ergebnis ist eine Untertiteldatei .srt mit dem chinesischen Text und den Start- und Endzeiten jedes Segments.
Verwenden kann man insbesondere:
- faster-whisper (medium)
- Qwen3-ASR ForcedAligner
Für Chinesisch bevorzuge ich Qwen3-ASR. Er ermöglicht unter anderem, vor der Transkription Kontext bereitzustellen, was dem Modell helfen kann, das richtige Zeichen zu wählen, wenn mehrere Wörter gleich ausgesprochen werden.
Wenn Sie anschließend Synchronisation oder Clippings planen, aktivieren Sie zusätzlich dieZeitstempel auf Wortebene. So erhalten Sie eine deutlich präzisere Ausrichtung zwischen Text und Stimme.
2. Die Passagen abrufen, die nicht transkribiert wurden
Eine automatische Transkription ist nicht immer perfekt. Musik beispielsweise kann die ASR stören. Manchmal hält das System eine Passage für Musik oder Gesang und transkribiert die Sprache nicht korrekt.
Um solche Probleme zu finden, kann man in der SRT-Datei nach ungewöhnlich langen Lücken zwischen zwei Untertiteln suchen.
Für jede fehlende Passage:
- holt man die entsprechende Passage mit ffmpeg ;
- hört sie erneut an;
- startet eine Transkription nur für diese Passage neu.
So lässt sich die Transkription vervollständigen, ohne das gesamte Video erneut bearbeiten zu müssen.
3. Die chinesische Transkription korrigieren
Die ASR kann Fehler machen, insbesondere bei Homophonen : Das Modell erkennt den Laut korrekt, wählt aber das falsche chinesische Schriftzeichen oder Wort.
Daher liest man die verdächtigen Passagen noch einmal durch und korrigiert die Transkription, bevor mit der Übersetzung begonnen wird.
Eine fehlerhafte Transkription führt in der Regel zu einer fehlerhaften Übersetzung. Dieser Schritt verdient also besondere Aufmerksamkeit.
4. Vom Chinesischen ins Französische übersetzen
Sobald die chinesische Transkription korrigiert ist, wird sie in Segmente unterteilt. Die Segmente werden anschließend von einem autonomen Agenten, der auf Übersetzung spezialisiert ist, verarbeitet.
Der Agent konsultiert dabei insbesondere die Referenzdateien des Skills, um die im Voraus festgelegten Regeln einzuhalten:
- Sprachniveau und Register;
- natürliches Französisch statt wörtlicher Übersetzung;
- Übersetzung von Eigennamen;
- wiederkehrende Begriffe aus dem Glossar;
- spezifische Regeln für Dialoge.
Die Übersetzungen werden anschließend zusammengesetzt, wobei die Zeitstempel der chinesischen Dateibeibehalten werden. Bei langen Videos ist es ratsam, ein Segment nach dem anderen. Autonome Agenten können den Text so verarbeiten, ohne den Kontext der Hauptsitzung zu überlasten.
5. Übersetzung prüfen und bereinigen
Sobald die Übersetzung abgeschlossen ist, werden mehrere automatische Kontrollen durchgeführt:
- keine chinesischen Schriftzeichen dürfen in der französischen Datei verbleiben;
- das SRT-Format muss gültig sein;
- die Zeitangaben müssen konsistent sein;
- das Register muss einheitlich bleiben;
- die Übersetzung muss von Anfang bis Ende stimmig bleiben.
Ein weiterer Agent kann anschließend eine kritische Durchsicht Chinesisch ↔ Französischdurchführen. Seine Aufgabe ist es, Sinnfehler, Auslassungen und Übersetzungen aufzuspüren, die den ursprünglichen Sinn verändern. Diese Überprüfung ist besonders nützlich, wenn die Übersetzung Segment für Segment erfolgt ist: Sie stellt sicher, dass das Gesamtbild stimmig bleibt.
Schließlich werden die Untertitel für die Anzeige auf dem Bildschirm vorbereitet:
- der Text wird an natürlichen Stellen umgebrochen;
- der Text wird auf ein oder zwei Zeilen verteilt;
- die Länge und Lesbarkeit werden überprüft;
- es wird sichergestellt, dass kein Wort verloren gegangen ist.
Die ursprüngliche chinesische Datei wird als Referenz aufbewahrt, um beide Versionen vergleichen zu können.
6. Das Endergebnis
Das Hauptergebnis ist eine Datei:
video.fr.srt
Sie enthält die französischen Untertitel mit ihren Zeitangaben.
Ausgehend von dieser Datei kann man anschließend:
- die französischen Untertitel in das Video einbrennen mit ffmpeg;
- eine französisch synchronisierte Version erstellen (Text-to-Speech, mit den kostenlosen Stimmen von Edge oder Mac);
- automatisch Clippings erstellen oder Videoausschnitte aus den Untertiteln und ihren Timestamps.
Zusammenfassung
Der komplette Workflow lässt sich wie folgt zusammenfassen:
Chinesisches Video → Transkription → Korrektur → Übersetzung → Qualitätskontrolle → französische Untertitel → Synchronisation / Clippings
Der Vorteil dieser Organisation besteht darin, die verschiedenen Aufgaben klar zu trennen und die autonomen Agenten die umfangreichsten Teile bearbeiten zu lassen. So bleibt die Hauptsitzung leicht und konzentriert sich auf die Orchestrierung des Workflows.