Réponse rapide : le modèle Whisper d'OpenAI n'est pas une application — c'est une bibliothèque Python qu'on installe et qu'on exécute depuis le terminal, ce qui implique Homebrew, la bonne version de Python, un environnement virtuel, FFmpeg et, bien souvent, une série d'erreurs de dépendances avant d'obtenir la moindre transcription. Si vous préférez ne pas toucher au code, le chemin le plus rapide vers la même transcription privée, exécutée localement, est une application Mac qui embarque déjà Whisper — comme Subtitle Studio — qui élimine toute cette installation et ajoute au passage des outils de prétraitement et d'édition que Whisper brut n'offre pas.
Si vous avez cherché « comment faire tourner Whisper sur Mac » et que vous êtes tombé sur un guide où l'étape 1 est précédée de six autres étapes sans qu'on ait encore parlé de votre fichier audio, vous n'avez rien imaginé. Voici pourquoi, où la plupart des gens bloquent, et quelle alternative existe sans écrire de code.
Qu'est-ce qu'OpenAI Whisper (et pourquoi ce n'est pas une application)
Whisper est le modèle de reconnaissance vocale open source d'OpenAI, sorti en 2022 et régulièrement mis à jour depuis (large-v3, turbo). Il est réellement excellent — précis dans plus de 90 langues, gratuit, et il fonctionne entièrement sur votre propre machine sans qu'aucun audio ne soit envoyé où que ce soit. C'est exactement pour cette raison que tant de gens veulent le faire tourner eux-mêmes.
Le dépôt GitHub openai/whisper — 106k étoiles, mais un dépôt de code source sans bouton de téléchargement, sans installateur et sans application à ouvrir
Remarquez ce qui manque sur cette page : un bouton de téléchargement, un installateur, une icône d'application. Ce que vous obtenez, c'est un dossier de code source Python — 106 000 personnes ont mis une étoile à ce dépôt, mais mettre une étoile n'installe rien sur votre Mac.
Le dépôt GitHub est en réalité une base de code de recherche, pas un produit grand public. Les instructions officielles d'installation supposent que vous êtes à l'aise avec :
- L'installation et la gestion de plusieurs versions de Python
- L'utilisation de
pipet des environnements virtuels - La lecture d'une trace d'erreur Python (traceback) quand quelque chose casse
- L'installation d'une dépendance système (FFmpeg) séparément du modèle lui-même
Rien de tout cela n'est déraisonnable pour un chercheur en machine learning. C'est en revanche beaucoup demander à quelqu'un qui veut simplement des sous-titres pour une vidéo YouTube ce soir.
La méthode « officielle » pour faire tourner Whisper sur Mac, étape par étape
Pour être honnête avec l'équipe Whisper, le README est bien écrit. Voici ce qu'il faut réellement faire pour passer de « rien n'est installé » à « une transcription s'affiche à l'écran ».
Étape 1 : installer Homebrew
Si vous n'avez pas déjà ce gestionnaire de paquets non officiel d'Apple, c'est la première installation :
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Étape 2 : installer une version compatible de Python
La chaîne de dépendances de Whisper (numba, tiktoken, PyTorch) ne supporte pas les toutes dernières versions de Python. À l'heure où ces lignes sont écrites, Python 3.13 casse l'installation — il vous faut la 3.10, la 3.11 ou la 3.12 :
brew install python@3.11
Étape 3 : créer un environnement virtuel
Pour éviter que les dépendances de Whisper n'entrent en conflit avec le reste de votre système, l'approche recommandée est un environnement isolé :
python3.11 -m venv whisper-env
source whisper-env/bin/activate
Étape 4 : installer FFmpeg
Whisper ne décode pas l'audio lui-même — il délègue cette tâche à FFmpeg, qui s'installe séparément :
brew install ffmpeg
Étape 5 : installer Whisper
pip install -U openai-whisper
Étape 6 : lancer votre première transcription
whisper your-audio.mp3 --model turbo
Six étapes, trois installateurs distincts, une contrainte de version de Python qu'il fallait déjà connaître — et vous n'avez encore transcrit aucun mot. Et c'est le scénario où rien ne se passe mal.
Où tout le monde bloque (de vrais problèmes signalés sur GitHub et StackOverflow)
Cherchez les problèmes d'installation d'« openai-whisper » et vous tomberez encore et encore sur la même poignée d'échecs. Ce qui suit est cité directement à partir de vrais signalements, sans paraphrase.
« Whisper ne peut pas être utilisé avec Python 3.13 »
Si vous installez la dernière version de Python depuis python.org au lieu de figer une version plus ancienne via Homebrew, l'installation échoue immédiatement :
Getting requirements to build wheel ... error
KeyError: '__version__'
Comme le résume clairement une réponse sur le fil de discussion : « Whisper cannot be used on Python 3.13 using only released, supported versions of its dependency chain. » (Source : StackOverflow) La solution consiste à revenir à une version antérieure de Python et à reconstruire son environnement virtuel depuis zéro — pas franchement évident si vous ne savez pas déjà que Whisper est sensible à la version.
« ffmpeg introuvable » — même après avoir installé ffmpeg
C'est l'une des erreurs Whisper les plus courantes sur Mac, et elle déroute justement parce que la solution évidente a l'air d'avoir déjà été appliquée :
FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'
Dans ce cas précis, l'utilisateur avait déjà lancé brew install ffmpeg avec succès, l'avait réinstallé, et avait même essayé un wrapper Python pour FFmpeg — le vrai problème était que l'exécutable de FFmpeg n'était pas dans le PATH visible par Python. (Source : StackOverflow) Diagnostiquer un problème de PATH suppose déjà de savoir ce qu'est un PATH.
Il n'y a pas de CUDA sur un Mac — et la plupart des tutoriels partent du principe que si
Presque tous les guides de performance sur Whisper parlent de CUDA, le framework GPU de NVIDIA. Or les Mac n'ont pas de GPU NVIDIA. Les puces Apple Silicon utilisent MPS (Metal Performance Shaders) à la place, et le support de MPS dans PyTorch présente de vraies lacunes, bien documentées :
NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.
C'est une erreur bien réelle, rencontrée sur un modèle PyTorch proche de Whisper, sur Apple Silicon. (Source : GitHub — huggingface/transformers #31408) La solution proposée consiste à retomber sur le CPU pour cette opération — autrement dit, ralentir le traitement pour contourner un bug qui n'existe que parce que vous êtes sur Mac.
Des erreurs de compilateur Rust pendant l'installation
Whisper dépend du tokenizer tiktoken d'OpenAI. Si votre plateforme n'a pas de wheel précompilé disponible, pip tente de le compiler depuis les sources, ce qui requiert une chaîne d'outils Rust que vous n'avez probablement pas installée. Le README officiel aborde d'ailleurs directement le sujet : si l'installation échoue avec No module named 'setuptools_rust', il faut installer séparément setuptools-rust, voire l'environnement de développement Rust complet. Installer une chaîne de compilation, tout ça pour faire tourner un modèle de reconnaissance vocale.
Les options « plus rapides » demandent de compiler depuis les sources
Whisper tournant sur PyTorch en version standard est sensiblement lent sur Mac, d'où le conseil habituel de passer à whisper.cpp ou mlx-whisper pour profiter réellement de la vitesse d'Apple Silicon. Les deux sont plus rapides — mais échangent la configuration Python contre un autre type de configuration :
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav
Cela suppose git, une chaîne de compilation C++, et le téléchargement manuel des fichiers de modèle — on est loin du « sans coder ». Et même une fois la compilation réussie, les choses peuvent encore dérailler de façon franchement difficile à diagnostiquer. Un utilisateur expérimenté raconte avoir fait tourner un lot de fichiers via un binaire whisper.cpp compilé maison sur un Mac mini M4 : cela « fonctionne parfaitement » sur un M1, mais sur le M4, le processus « s'arrête tout simplement » de produire quoi que ce soit après quelques heures, sans erreur ni plantage — la solution a été d'écrire un script pour tuer et relancer le processus toutes les heures. (« Whisper continue de tourner, il n'y a aucune erreur dans le terminal, aucun plantage... il n'y a simplement plus aucune sortie. ») (Source : Ars Technica OpenForum)
Ce n'est pas une erreur de débutant — c'est un utilisateur chevronné qui a quand même buté sur un mur nécessitant un script et une tâche planifiée pour être contourné.
« Le processus d'installation est extrêmement peu convivial »
Cette plainte, déposée en tant que ticket GitHub sur un outil basé sur Whisper, résume à elle seule toute l'expérience pour un non-développeur : « The installer is extremely unfriendly, constantly interrupting the download of large files, resulting in incomplete installation and a missing executable file... For those without programming skills, uninstallation is the only option. » (Source : GitHub — meizhong986/WhisperJAV #85) La résolution du fil de discussion était, encore une fois, un problème de version de Python — un inconnu ayant guidé pas à pas l'auteur du ticket via des commandes de terminal jusqu'à ce que ça fonctionne.
Même quand ça fonctionne, les gros modèles peuvent saturer la mémoire
Le modèle large-v3 a besoin d'environ 10 Go de VRAM/mémoire unifiée pour tourner confortablement. Sur un MacBook d'entrée de gamme avec 8 Go ou 16 Go, la marge est suffisamment mince pour faire planter le processus, obligeant à se rabattre sur un modèle plus petit et moins précis en guise de solution de contournement.
Même une fois que ça tourne, Whisper seul ne produit pas des sous-titres
Supposons que vous surmontiez tout ce qui précède et obteniez enfin une commande whisper your-video.mp4 --model large-v3 qui fonctionne. Ce que vous récupérez, c'est une transcription, pas des sous-titres — et pour une vidéo, ce n'est pas le même travail :
- Aucun prétraitement. Whisper reçoit votre audio brut tel quel. S'il y a de la musique de fond, un écho de pièce ou une intro bruyante, le modèle n'a aucune idée qu'il faut l'ignorer — et il est bien documenté qu'il hallucine du texte (répétition de phrases, invention de dialogues) pendant les silences ou les plages musicales plutôt que d'admettre une incertitude.
- Un minutage approximatif. Les horodatages intégrés de Whisper sont arrondis à peu près à la seconde près — suffisant pour une transcription, pas pour un sous-titre qui doit apparaître exactement quand quelqu'un parle.
- Aucune logique de retour à la ligne. Des blocs interminables ou des coupures maladroites en plein milieu d'une phrase sont fréquents dans la sortie brute, et il n'existe aucun outil pour les corriger, à part ouvrir le fichier
.srtdans un éditeur de texte. - Aucune traduction. Si vous avez besoin d'une piste dans une autre langue, c'est un tout autre outil et un tout autre flux de travail.
- Aucune interface d'édition. Tout se passe en ligne de commande. Pas de forme d'onde, pas de glisser-ajuster, pas de bouton annuler.
Autrement dit, résoudre le problème d'installation ne résout pas le problème des sous-titres. Il vous faudra toujours un second outil pour transformer une transcription brute en quelque chose que vous seriez réellement prêt à publier.
La méthode la plus simple : oublier Python et passer par Subtitle Studio
Subtitle Studio fait tourner la même famille de modèle Whisper, mais sous la forme d'une application Mac native : téléchargez-la, glissez-y votre vidéo, récupérez vos sous-titres. Pas de terminal, pas de version de Python à gérer, pas d'erreur pip install à déboguer.
Éditeur Subtitle Studio avec forme d'onde, liste des sous-titres et aperçu vidéo alignés sur la voix
Ce que vous obtenez en plus d'une installation sans terminal :
- Un modèle optimisé pour Apple Silicon. Le modèle de transcription est spécifiquement optimisé pour les puces de la gamme M avec accélération Metal — pas une build PyTorch générique qui retombe sur le CPU dès qu'une opération MPS n'est pas prise en charge.
- Un prétraitement avant la transcription. La détection d'activité vocale (VAD) et la réduction de bruit nettoient l'audio avant que Whisper ne le reçoive, ce qui réduit les mots perdus et le texte halluciné causés par la musique de fond ou le bruit ambiant — exactement le mode de défaillance pour lequel Whisper brut est connu.
- Un filtrage des hallucinations. Un score de confiance combiné à une analyse de l'activité vocale détecte et supprime le texte fantôme que le modèle invente pendant les silences ou la musique, au lieu de l'envoyer tel quel dans votre fichier de sous-titres.
- Un alignement forcé. Après la transcription, un aligneur forcé remappe le texte sur la forme d'onde au niveau du mot, remplaçant les horodatages de Whisper, arrondis à la seconde près, par un minutage précis à l'image près.
- Une segmentation basée sur le NLP. La transcription brute est découpée en lignes de sous-titres lisibles, aux frontières naturelles des phrases, plutôt qu'à un nombre arbitraire de caractères.
- Une édition intégrée. Glissez pour réaligner le minutage d'un sous-titre, découpez une ligne trop longue, ou fusionnez des fragments — sans jamais exporter vers un éditeur de texte.
Outil de réalignement de Subtitle Studio, avec un bloc de sous-titre déplacé pour correspondre à la forme d'onde audio
- Une traduction embarquée sur l'appareil. Traduisez vos sous-titres terminés dans 25 langues, entièrement hors ligne, sans clé d'API ni coût au mot — voir notre dossier complet sur la traduction hors ligne pour comprendre comment fonctionne le modèle local.
Panneau de traduction de Subtitle Studio avec sélecteur de langue et options de fournisseur d'IA
Votre audio et votre vidéo ne quittent jamais votre Mac — la même garantie de confidentialité que si vous faisiez tourner Whisper vous-même, sans la configuration.
Subtitle Studio
Achat unique. Fonctionne entièrement hors ligne sur votre Mac.
Whisper en ligne de commande vs Subtitle Studio — comparatif côte à côte
| OpenAI Whisper (CLI) | Subtitle Studio | |
|---|---|---|
| Installation | Homebrew, gestion de version Python, environnement virtuel, FFmpeg, pip install | Télécharger l'app, l'ouvrir |
| Code requis | Oui — commandes en terminal, dépannage occasionnel de dépendances | Non |
| Accélération Apple Silicon | Dépend du support MPS de PyTorch (avec des lacunes) | Intégrée, modèle optimisé Metal |
| Prétraitement audio | Aucun — audio brut envoyé au modèle | VAD + réduction de bruit avant transcription |
| Gestion des hallucinations | Aucune — sortie brute du modèle | Détectées et filtrées automatiquement |
| Précision du minutage | Granularité d'environ 1 seconde | Alignement forcé au niveau du mot |
| Retour à la ligne des sous-titres | Aucun — nettoyage manuel requis | Segmentation automatique basée sur le NLP |
| Outils d'édition | Éditeur de texte sur le fichier exporté | Réalignement, découpe et fusion basés sur la forme d'onde |
| Traduction | Non incluse | Intégrée, hors ligne, 25 langues |
| Format de sortie | .txt, .srt, .vtt | .srt, .fcpxml |
| Coût | Gratuit (votre temps) | Achat unique |
Verdict
Si vous êtes développeur et que vous voulez intégrer Whisper dans un pipeline scripté, traiter des milliers de fichiers en lot ou fine-tuner le modèle vous-même, l'outil officiel en ligne de commande est le bon choix — cette flexibilité est exactement ce pour quoi il a été conçu, et le coût de configuration ne se paie qu'une seule fois.
Si vous voulez simplement des sous-titres précis et prêts à publier pour une vidéo, sans jamais ouvrir un terminal, la voie sans code vous y mène plus vite : la même technologie sous le capot, sans la gestion d'environnement, plus tout un ensemble d'outils spécifiques aux sous-titres que Whisper brut n'a jamais été conçu pour inclure.
Subtitle Studio
Sans Python, sans Homebrew, sans terminal. Glissez simplement votre vidéo.
Foire aux questions
Faut-il connaître Python pour faire tourner Whisper sur Mac ?
Pour utiliser le paquet officiel openai-whisper, oui — il faudra installer Python, gérer un environnement virtuel et lancer des commandes depuis le terminal. Si vous préférez ne pas toucher au code, des applications comme Subtitle Studio font tourner la même famille de modèle avec une interface glisser-déposer, sans écrire une seule ligne de code.
Pourquoi l'installation de Whisper échoue-t-elle sur mon Mac ?
Les causes les plus courantes sont : l'utilisation d'une version de Python non supportée (la 3.13 casse actuellement l'installation ; utilisez 3.10 à 3.12), FFmpeg absent du PATH système même après son installation, et l'absence d'un compilateur Rust nécessaire pour construire la dépendance tiktoken depuis les sources. Chacune de ces causes produit un message d'erreur différent et plutôt cryptique.
Whisper utilise-t-il le GPU de mon Mac ?
Oui, potentiellement, via le backend MPS (Metal Performance Shaders) d'Apple dans PyTorch, mais le support de MPS pour les opérations de Whisper comporte des lacunes documentées — certains opérateurs ne sont pas implémentés et retombent silencieusement sur une exécution CPU plus lente. whisper.cpp et mlx-whisper exploitent en général Apple Silicon plus efficacement que le paquet Python original, mais tous deux nécessitent une compilation depuis les sources.
Quelle est la différence entre openai-whisper, whisper.cpp et mlx-whisper ?
openai-whisper est le paquet Python original d'OpenAI — le plus simple à installer via pip, mais plus lent sur Apple Silicon puisqu'il passe par le backend MPS de PyTorch. whisper.cpp est une réimplémentation en C++ qui utilise directement Metal et est nettement plus rapide, mais il faut cloner le dépôt et le compiler soi-même. mlx-whisper utilise le framework MLX d'Apple et constitue souvent l'option la plus rapide sur les puces de la gamme M, avec une installation depuis les sources similaire. Aucun des trois n'inclut de prétraitement audio, d'édition de sous-titres ou de traduction — ce sont des moteurs de transcription, pas des outils de sous-titrage.
Existe-t-il un moyen gratuit de faire tourner Whisper sur Mac sans coder ?
Le modèle Whisper lui-même est gratuit et open source, mais le faire tourner sans aucune configuration nécessite une application packagée plutôt que la bibliothèque Python brute — quelqu'un doit s'occuper de l'installation, de la gestion du modèle et de l'interface à votre place. Subtitle Studio est une application Mac conçue précisément pour cela : pas de terminal, pas de dépendances à gérer, un achat unique plutôt qu'un abonnement.
Subtitle Studio utilise-t-il le même modèle Whisper que la ligne de commande ?
Subtitle Studio utilise un modèle Whisper optimisé et affiné, conçu pour le type d'audio mixte auquel les créateurs de vidéos sont réellement confrontés — dialogues sur musique, bruit ambiant, discours multilingue — associé à une accélération Apple Silicon. Il est intégré dans un pipeline complet (prétraitement, filtrage des hallucinations, alignement forcé, segmentation NLP) plutôt que d'être le modèle autonome que vous obtiendriez avec pip install openai-whisper. Consultez notre comparatif MacWhisper vs Subtitle Studio pour voir de plus près comment ce pipeline influence le résultat final.
Essayez Subtitle Studio gratuitement
Paiement unique. Sans abonnement. Entièrement hors ligne sur votre Mac.

