Alle Artikel
Whispermacanleitungno-codeopenaiuntertitel

OpenAI Whisper auf dem Mac nutzen:
Der einfachste Weg ohne Programmierkenntnisse

OpenAI Whisper ist kostenlos und präzise, aber auf dem Mac braucht man dafür Python, Homebrew und FFmpeg. So bekommst du dieselbe Transkription ganz ohne Code.

·Tom Mong
Für Mac laden — kostenlos
OpenAI Whisper auf dem Mac nutzen: Der einfachste Weg ohne Programmierkenntnisse

Kurz gesagt: OpenAIs Whisper-Modell selbst ist keine App — es ist eine Python-Bibliothek, die man über das Terminal installiert und ausführt. Das bedeutet Homebrew, die richtige Python-Version, eine virtuelle Umgebung, FFmpeg und (häufig) einen ganzen Stapel an Abhängigkeitsfehlern, bevor überhaupt ein erstes Transkript entsteht. Wer keinen Code anfassen möchte, kommt am schnellsten zur gleichen privaten, lokalen Transkription über eine Mac-App, die Whisper bereits eingebaut hat — etwa Subtitle Studio — die die ganze Einrichtung überspringt und zusätzlich Vorverarbeitung und Bearbeitungswerkzeuge mitbringt, die das rohe Whisper nicht hat.

Wer nach „Whisper auf dem Mac ausführen" gesucht und eine Anleitung mit sechs Schritten gefunden hat, bei der die eigentliche Audiodatei erst nach Schritt eins überhaupt erwähnt wird, bildet sich das nicht ein. Hier erfährst du, warum das so ist, wo die meisten Leute hängen bleiben und welche Alternative es ohne Code gibt.


Was Ist OpenAI Whisper (Und Warum Ist Es Keine App)

Whisper ist OpenAIs quelloffenes Spracherkennungsmodell, das 2022 erschien und seitdem aktualisiert wird (large-v3, turbo). Es ist wirklich hervorragend — präzise in über 90 Sprachen, kostenlos nutzbar, und es läuft komplett auf dem eigenen Rechner, ohne dass irgendwo Audio hochgeladen wird. Genau deshalb wollen so viele Leute es selbst betreiben.

Das GitHub-Repository openai/whisper — 106.000 Sterne, aber ein reines Quellcode-Repository ohne Download-Button, ohne Installer und ohne App zum ÖffnenDas GitHub-Repository openai/whisper — 106.000 Sterne, aber ein reines Quellcode-Repository ohne Download-Button, ohne Installer und ohne App zum Öffnen

Man beachte, was auf dieser Seite fehlt: ein Download-Button, ein Installationsprogramm, ein App-Icon. Was man tatsächlich bekommt, ist ein Ordner mit Python-Quellcode — 106.000 Menschen haben dem Repository einen Stern gegeben, aber ein Stern installiert auf dem eigenen Mac gar nichts.

Das GitHub-Repository ist eben eine Forschungs-Codebasis, kein Endverbraucherprodukt. Die offizielle Installationsanleitung geht davon aus, dass man mit Folgendem vertraut ist:

  • Verschiedene Python-Versionen installieren und verwalten
  • pip und virtuelle Umgebungen benutzen
  • Einen Python-Traceback lesen, wenn etwas schiefgeht
  • Eine Systemabhängigkeit (FFmpeg) getrennt vom eigentlichen Modell installieren

All das ist für einen Machine-Learning-Forscher nicht unangemessen. Aber es ist ziemlich viel verlangt von jemandem, der bis heute Abend einfach nur Untertitel für ein YouTube-Video braucht.


Der „Offizielle" Weg, Whisper auf dem Mac Zu Nutzen, Schritt für Schritt

Um dem Whisper-Team gerecht zu werden: Die README ist gut geschrieben. Hier ist, was tatsächlich nötig ist, um von „nichts installiert" zu „Transkript auf dem Bildschirm" zu kommen.

Schritt 1: Homebrew installieren

Wer Apples inoffiziellen Paketmanager noch nicht hat, muss den zuerst installieren:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Schritt 2: Eine kompatible Python-Version installieren

Die Abhängigkeitskette von Whisper (numba, tiktoken, PyTorch) unterstützt die neuesten Python-Versionen nicht. Zum Zeitpunkt dieses Artikels bricht Python 3.13 die Installation ab — man braucht 3.10, 3.11 oder 3.12:

brew install python@3.11

Schritt 3: Eine virtuelle Umgebung anlegen

Damit sich die Abhängigkeiten von Whisper nicht mit anderen Dingen auf dem System in die Quere kommen, wird eine isolierte Umgebung empfohlen:

python3.11 -m venv whisper-env
source whisper-env/bin/activate

Schritt 4: FFmpeg installieren

Whisper dekodiert Audio nicht selbst — dafür ist FFmpeg zuständig, das separat installiert werden muss:

brew install ffmpeg

Schritt 5: Whisper installieren

pip install -U openai-whisper

Schritt 6: Die erste Transkription ausführen

whisper your-audio.mp3 --model turbo

Sechs Schritte, drei separate Installationsprogramme, eine Python-Versionsbeschränkung, die man schon vorher kennen musste — und dabei ist noch kein einziges Wort transkribiert. Und das ist die Version, bei der nichts schiefgeht.


Wo Fast Alle Hängen Bleiben (Echte Probleme von GitHub und StackOverflow)

Sucht man nach Installationsproblemen mit „openai-whisper", tauchen immer wieder dieselben Handvoll Fehler auf. Die folgenden Zitate stammen direkt aus echten Berichten und sind nicht umformuliert.

„Whisper kann unter Python 3.13 nicht verwendet werden"

Wer die neueste Python-Version von python.org installiert, anstatt mit Homebrew eine ältere Version festzulegen, bekommt sofort einen Installationsfehler:

Getting requirements to build wheel ... error
KeyError: '__version__'

Eine Antwort im entsprechenden Thread bringt es klar auf den Punkt: "Whisper cannot be used on Python 3.13 using only released, supported versions of its dependency chain." (Quelle: StackOverflow) Die Lösung besteht darin, die Python-Version herunterzustufen und die virtuelle Umgebung komplett neu aufzubauen — nicht gerade naheliegend, wenn man nicht bereits weiß, dass Whisper so versionsempfindlich ist.

„ffmpeg not found" — auch nach der Installation von ffmpeg

Das ist einer der häufigsten Whisper-Fehler auf dem Mac, und er ist gerade deshalb so verwirrend, weil die naheliegende Lösung eigentlich schon funktioniert haben sollte:

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

Der Nutzer in diesem Fall hatte bereits erfolgreich brew install ffmpeg ausgeführt, es neu installiert und sogar einen Python-FFmpeg-Wrapper ausprobiert — das eigentliche Problem war, dass die FFmpeg-Binärdatei nicht in dem PATH lag, den Python sehen konnte. (Quelle: StackOverflow) Ein PATH-Problem zu diagnostizieren setzt voraus, dass man überhaupt weiß, was ein PATH ist.

Auf dem Mac gibt es kein CUDA — die meisten Anleitungen gehen aber davon aus

Fast jede Anleitung zur Whisper-Performance spricht von CUDA, NVIDIAs GPU-Framework. Macs haben aber keine NVIDIA-GPUs. Apple Silicon nutzt stattdessen MPS (Metal Performance Shaders), und die MPS-Unterstützung in PyTorch hat reale, dokumentierte Lücken:

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

Das ist ein echter Fehler aus einem Whisper-verwandten PyTorch-Modell auf Apple Silicon. (Quelle: GitHub — huggingface/transformers #31408) Der vorgeschlagene Workaround weicht für diese Operation auf die CPU aus — das bedeutet langsamere Verarbeitung, nur um einen Fehler zu umgehen, der überhaupt nur existiert, weil man einen Mac benutzt.

Rust-Compiler-Fehler Bei der Installation

Whisper hängt vom tiktoken-Tokenizer von OpenAI ab. Ist für die eigene Plattform kein vorkompiliertes Wheel verfügbar, versucht pip, es aus dem Quellcode zu kompilieren — dafür braucht es eine Rust-Toolchain, die man wahrscheinlich nicht installiert hat. Die offizielle README geht direkt darauf ein: Schlägt die Installation mit No module named 'setuptools_rust' fehl, muss man setuptools-rust separat installieren, möglicherweise sogar die komplette Rust-Entwicklungsumgebung. Man installiert also eine Compiler-Toolchain, nur um ein Sprache-zu-Text-Modell auszuführen.

Die „Schnelleren" Optionen Verlangen Kompilierung aus dem Quellcode

Einfaches Whisper auf PyTorch läuft auf einem Mac merklich langsam, daher lautet der übliche Rat, für echtes Apple-Silicon-Tempo auf whisper.cpp oder mlx-whisper umzusteigen. Beide sind schneller — und beide tauschen die Python-Einrichtung gegen eine andere Art von Einrichtung ein:

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

Das bedeutet git, eine C++-Compiler-Toolchain und das manuelle Herunterladen von Modelldateien — das ist nicht gerade „ohne Programmierung". Und selbst nach korrekter Kompilierung kann noch einiges auf eine Weise schiefgehen, die sich wirklich schwer debuggen lässt. Ein langjähriger Nutzer beschrieb, wie er auf einem M4 Mac mini eine Reihe von Dateien über eine selbst kompilierte whisper.cpp-Binärdatei laufen ließ: Auf einem M1 „funktioniert es einwandfrei", aber auf dem M4 „hört es einfach auf", nach ein paar Stunden Output zu produzieren — ohne Fehlermeldung, ohne Absturz. Die Lösung bestand darin, ein Skript zu schreiben, das den Prozess stündlich beendet und neu startet. ("Whisper continues running, there are no errors in the terminal, no crashes... there's just no more output.") (Quelle: Ars Technica OpenForum)

Das ist kein Anfängerfehler — das ist ein erfahrener Nutzer, der trotzdem an eine Wand stieß, die nur mit Skript und Cron-Job zu umgehen war.

„Der Installationsprozess Ist Extrem Unfreundlich"

Diese Beschwerde, eingereicht als GitHub-Issue gegen ein Whisper-basiertes Tool, fasst die gesamte Erfahrung für Nicht-Entwickler zusammen: "The installer is extremely unfriendly, constantly interrupting the download of large files, resulting in incomplete installation and a missing executable file... For those without programming skills, uninstallation is the only option." (Quelle: GitHub — meizhong986/WhisperJAV #85) Die Lösung des Threads war, wieder einmal, eine Python-Versionsinkompatibilität — ein Fremder führte den Betroffenen Schritt für Schritt durch die Terminalbefehle, bis es funktionierte.

Selbst Wenn Es Läuft, Können Große Modelle den Speicher Sprengen

Das large-v3-Modell benötigt etwa 10 GB VRAM/gemeinsamen Speicher, um komfortabel zu laufen. Auf einem MacBook mit 8 GB oder 16 GB Basisausstattung ist das knapp genug, um den Prozess komplett abstürzen zu lassen, was einen Umstieg auf ein kleineres, weniger präzises Modell als Notlösung erzwingt.


Selbst Wenn Es Läuft: Whisper Allein Sind Noch Keine Untertitel

Angenommen, man kämpft sich durch alles Vorherige und bekommt einen funktionierenden Befehl whisper your-video.mp4 --model large-v3. Was man dann bekommt, ist ein Transkript, keine Untertitel — und bei Video ist das eine ganz andere Aufgabe:

  • Keine Vorverarbeitung. Whisper bekommt die rohe Audiospur genau so, wie sie ist. Gibt es Hintergrundmusik, Raumhall oder einen lauten Vorspann, weiß das Modell nicht, dass es das ignorieren soll — und es ist gut dokumentiert, dass es während Stille und Musikpassagen Text halluziniert (Phrasen wiederholt, Dialoge erfindet), statt Unsicherheit zuzugeben.
  • Ungefähres Timing. Die eingebauten Zeitstempel von Whisper sind auf ungefähr die nächste Sekunde gerundet — okay für ein Transkript, aber nicht für einen Untertitel, der genau dann erscheinen muss, wenn jemand spricht.
  • Keine Zeilenumbruch-Logik. Lange, zusammenhängende Blöcke oder unglückliche Trennungen mitten im Satz sind in der Rohausgabe üblich, und es gibt kein Werkzeug, um das zu beheben, außer die .srt-Datei in einem Texteditor zu öffnen.
  • Keine Übersetzung. Wer eine zweite Sprachspur braucht, benötigt dafür ein völlig separates Tool und einen eigenen Workflow.
  • Keine Bearbeitungsoberfläche. Alles läuft über die Kommandozeile. Keine Wellenform, kein Ziehen zum Anpassen, kein Rückgängig-Button.

Mit anderen Worten: Das Installationsproblem zu lösen, löst nicht das Untertitel-Problem. Am Ende braucht man trotzdem noch ein zweites Werkzeug, um aus einem groben Transkript etwas zu machen, das man tatsächlich veröffentlichen würde.


Der Einfachste Weg: Python Komplett Überspringen mit Subtitle Studio

Subtitle Studio nutzt dieselbe Klasse von Whisper-Modell, aber als native Mac-App: herunterladen, das eigene Video hineinziehen, Untertitel bekommen. Kein Terminal, keine Python-Version zu verwalten, kein pip install zum Debuggen.

Der Subtitle-Studio-Editor mit Wellenform, Untertitelliste und Videovorschau, synchron zur SpracheDer Subtitle-Studio-Editor mit Wellenform, Untertitelliste und Videovorschau, synchron zur Sprache

Zusätzlich zur terminalfreien Installation bekommt man:

  • Ein für Apple Silicon abgestimmtes Modell. Das Transkriptionsmodell ist speziell für Chips der M-Serie mit Metal-Beschleunigung optimiert — kein generischer PyTorch-Build, der bei nicht unterstützten MPS-Operationen auf die CPU ausweicht.
  • Vorverarbeitung vor der Transkription. Sprachaktivitätserkennung (VAD) und Rauschunterdrückung reinigen das Audio, bevor Whisper es überhaupt sieht, sodass Hintergrundmusik und Raumgeräusche zu weniger verlorenen Wörtern und weniger halluziniertem Text führen — genau der Fehlertyp, für den rohes Whisper bekannt ist.
  • Halluzinations-Filterung. Konfidenzbewertung und Sprachaktivitätsanalyse erkennen und entfernen Phantomtext, den das Modell während Stille oder Musik erfindet, statt ihn direkt in die Untertiteldatei zu übernehmen.
  • Erzwungene Ausrichtung (Forced Alignment). Nach der Transkription bildet ein erzwungener Aligner den Text auf Wortebene wieder auf die Wellenform ab und ersetzt Whispers auf etwa eine Sekunde gerundete Zeitstempel durch bildgenaues Timing.
  • NLP-basierte Segmentierung. Das rohe Transkript wird an natürlichen Phrasengrenzen in gut lesbare Untertitelzeilen aufgeteilt, statt anhand willkürlicher Zeichenzahlen.
  • Eingebaute Bearbeitung. Ziehen, um das Timing eines Untertitels neu auszurichten, eine zu lange Zeile teilen oder fragmentierte Zeilen zusammenführen — ganz ohne Export in einen Texteditor.

Das Realign-Werkzeug von Subtitle Studio, während ein Untertitelblock gezogen wird, um zur Audio-Wellenform zu passenDas Realign-Werkzeug von Subtitle Studio, während ein Untertitelblock gezogen wird, um zur Audio-Wellenform zu passen

  • Übersetzung direkt auf dem Gerät. Die fertigen Untertitel in 25 Sprachen übersetzen, komplett offline, ohne API-Schlüssel und ohne Kosten pro Wort — mehr dazu in unserem ausführlichen Beitrag zur Offline-Übersetzung, wie das lokale Modell funktioniert.

Das Übersetzungspanel von Subtitle Studio mit Sprachauswahl und KI-AnbieteroptionenDas Übersetzungspanel von Subtitle Studio mit Sprachauswahl und KI-Anbieteroptionen

Audio und Video verlassen nie den eigenen Mac — dieselbe Datenschutzgarantie wie beim eigenen Betrieb von Whisper, nur ohne die Einrichtung.

Subtitle Studio

Einmalzahlung. Läuft komplett offline auf deinem Mac.


Whisper CLI vs. Subtitle Studio — Im Direktvergleich

OpenAI Whisper (CLI)Subtitle Studio
EinrichtungHomebrew, Python-Versionsverwaltung, virtuelle Umgebung, FFmpeg, pip installApp herunterladen, öffnen
Programmierung nötigJa — Terminalbefehle, gelegentliches Debugging von AbhängigkeitenNein
Apple-Silicon-BeschleunigungAbhängig von der MPS-Unterstützung in PyTorch (mit Lücken)Eingebaut, Metal-optimiertes Modell
Audio-VorverarbeitungKeine — rohes Audio wird direkt an das Modell gesendetVAD + Rauschunterdrückung vor der Transkription
Umgang mit HalluzinationenKeiner — rohe ModellausgabeAutomatisch erkannt und gefiltert
Genauigkeit der Zeitstempel~1 Sekunde GranularitätErzwungene Ausrichtung auf Wortebene
Zeilenumbrüche bei UntertitelnKeine — manuelle Nachbearbeitung nötigAutomatische, NLP-basierte Segmentierung
BearbeitungswerkzeugeTexteditor auf der exportierten DateiWellenform-basiertes Neuausrichten, Teilen, Zusammenführen
ÜbersetzungNicht enthaltenEingebaut, offline, 25 Sprachen
Ausgabeformat.txt, .srt, .vtt.srt, .fcpxml
KostenKostenlos (dafür deine Zeit)Einmalzahlung

Fazit

Wer als Entwickler Whisper in eine automatisierte Pipeline einbinden, tausende Dateien im Batch verarbeiten oder das Modell selbst feinabstimmen möchte, ist mit dem offiziellen CLI-Tool richtig beraten — genau für diese Flexibilität ist es gebaut, und die Einrichtungskosten fallen nur einmal an.

Wer einfach nur präzise, veröffentlichungsfertige Untertitel für ein Video haben möchte, ohne je ein Terminal zu öffnen, kommt über den codefreien Weg schneller ans Ziel: dieselbe zugrunde liegende Technologie, keinerlei Umgebungsverwaltung und eine Reihe von Untertitel-spezifischen Werkzeugen, die das rohe Whisper nie zu bieten hatte.

Subtitle Studio

Kein Python, kein Homebrew, kein Terminal. Einfach das Video hineinziehen.


Häufig Gestellte Fragen

Muss ich Python können, um Whisper auf einem Mac zu nutzen?

Um das offizielle openai-whisper-Paket zu nutzen, ja — man muss Python installieren, eine virtuelle Umgebung verwalten und Befehle im Terminal ausführen. Wer keinen Code anfassen möchte: Apps wie Subtitle Studio nutzen dieselbe Modellklasse mit einer Drag-and-Drop-Oberfläche, ganz ohne Programmierung.

Warum schlägt die Whisper-Installation auf meinem Mac fehl?

Die häufigsten Ursachen sind: die Verwendung einer nicht unterstützten Python-Version (aktuell bricht 3.13 die Installation ab; 3.10–3.12 verwenden), FFmpeg, das auch nach der Installation nicht im System-PATH liegt, und ein fehlender Rust-Compiler, der zum Erstellen der tiktoken-Abhängigkeit aus dem Quellcode benötigt wird. Jede dieser Ursachen erzeugt eine andere, ziemlich kryptische Fehlermeldung.

Nutzt Whisper die GPU meines Macs?

Das kann es, über Apples MPS-Backend (Metal Performance Shaders) in PyTorch, aber die MPS-Unterstützung für Whispers Operationen hat dokumentierte Lücken — manche Operatoren sind nicht implementiert und weichen still auf die langsamere CPU-Ausführung aus. whisper.cpp und mlx-whisper nutzen Apple Silicon generell effizienter als das originale Python-Paket, aber beide müssen aus dem Quellcode kompiliert werden.

Was Ist der Unterschied Zwischen openai-whisper, whisper.cpp und mlx-whisper?

openai-whisper ist das originale Python-Paket von OpenAI — am einfachsten per pip zu installieren, aber langsamer auf Apple Silicon, da es über PyTorchs MPS-Backend läuft. whisper.cpp ist eine C++-Neuimplementierung, die Metal direkt nutzt und deutlich schneller ist, erfordert aber, das Repository selbst zu klonen und zu kompilieren. mlx-whisper nutzt Apples eigenes MLX-Framework und ist auf Chips der M-Serie oft die schnellste Option, mit ähnlicher Einrichtung aus dem Quellcode. Keine der drei Varianten enthält Audio-Vorverarbeitung, Untertitelbearbeitung oder Übersetzung — es sind Transkriptions-Engines, keine Untertitelwerkzeuge.

Gibt es eine Kostenlose Möglichkeit, Whisper auf dem Mac Ohne Programmieren Zu Nutzen?

Das Whisper-Modell selbst ist kostenlos und quelloffen, aber es ohne jede Einrichtung zu nutzen, erfordert eine fertig verpackte App statt der rohen Python-Bibliothek — jemand muss sich für einen um Installation, Modellverwaltung und Oberfläche kümmern. Subtitle Studio ist eine Mac-App, die genau dafür gebaut wurde: kein Terminal, keine Abhängigkeiten zu verwalten, Einmalzahlung statt Abo.

Nutzt Subtitle Studio Dasselbe Whisper-Modell Wie die Kommandozeile?

Subtitle Studio nutzt ein optimiertes, feinabgestimmtes Whisper-Modell, das für die Art von gemischtem Audio gebaut wurde, mit dem Videocreator tatsächlich arbeiten — Dialog über Musik, Raumgeräusche und mehrsprachige Sprache —, kombiniert mit Apple-Silicon-Beschleunigung. Es steckt in einer vollständigen Pipeline (Vorverarbeitung, Halluzinationsfilterung, erzwungene Ausrichtung, NLP-Segmentierung), statt dem eigenständigen Modell, das man mit pip install openai-whisper bekäme. Mehr dazu im Vergleich MacWhisper vs. Subtitle Studio, der genauer zeigt, wie sich diese Pipeline auf das tatsächliche Ergebnis auswirkt.

Subtitle Studio kostenlos testen

Einmalzahlung. Kein Abo. Vollständig offline auf Ihrem Mac.

Für Mac laden — kostenlos