Короткий ответ: сам по себе Whisper от OpenAI — это не приложение, а Python-библиотека, которую нужно устанавливать и запускать из терминала. А значит, прежде чем получить первую расшифровку, придётся установить Homebrew, найти нужную версию Python, создать виртуальное окружение, поставить FFmpeg и (почти наверняка) разобраться с парой-тройкой ошибок зависимостей. Если программировать не хочется, самый быстрый способ получить такую же приватную транскрибацию прямо на устройстве — приложение для Mac, в которое Whisper уже встроен, например Subtitle Studio. Оно полностью убирает этап настройки и добавляет предобработку и инструменты редактирования, которых у голого Whisper попросту нет.
Если вы искали «как запустить Whisper на Mac» и наткнулись на инструкцию, где до первого шага ещё шесть пунктов, а про ваш собственный аудиофайл речи вообще не идёт, — вам не показалось. Дальше — почему так происходит, где именно все застревают и какая есть альтернатива без кода.
Что такое OpenAI Whisper (и почему это не приложение)
Whisper — это модель распознавания речи с открытым исходным кодом от OpenAI, выпущенная в 2022 году и с тех пор регулярно обновляемая (large-v3, turbo). Модель действительно хороша: точная более чем в 90 языках, бесплатная и работающая полностью на вашем собственном устройстве без загрузки аудио куда-либо. Именно поэтому столько людей хотят запустить её самостоятельно.
Репозиторий openai/whisper на GitHub — 106 тысяч звёзд, но это репозиторий с исходным кодом без кнопки скачивания, без установщика и без приложения, которое можно открыть
Обратите внимание, чего на этой странице нет: кнопки скачивания, установщика, значка приложения. Вместо этого вы получаете папку с исходным кодом на Python — 106 000 человек поставили репозиторию звезду, но звезда не устанавливает на ваш Mac абсолютно ничего.
А ведь GitHub-репозиторий — это исследовательский код, а не готовый продукт для конечного пользователя. Официальная инструкция по установке предполагает, что вы спокойно умеете:
- устанавливать и переключать разные версии Python;
- пользоваться
pipи виртуальными окружениями; - читать трассировку ошибок Python, когда что-то ломается;
- отдельно от самой модели устанавливать системную зависимость (FFmpeg).
Для исследователя в области машинного обучения всё это вполне разумные требования. Но для человека, которому просто нужны субтитры к ролику на YouTube сегодня вечером, — это уже немало.
«Официальный» способ запустить Whisper на Mac: шаг за шагом
Надо отдать должное команде Whisper — README написан хорошо. Вот что на самом деле требуется, чтобы пройти путь от «ничего не установлено» до «расшифровка на экране».
Шаг 1. Установите Homebrew
Если у вас ещё нет этого неофициального пакетного менеджера от сообщества вокруг Apple, начинать нужно с него:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Шаг 2. Установите совместимую версию Python
Цепочка зависимостей Whisper (numba, tiktoken, PyTorch) не поддерживает самые свежие релизы Python. На момент написания статьи Python 3.13 ломает установку — нужна версия 3.10, 3.11 или 3.12:
brew install python@3.11
Шаг 3. Создайте виртуальное окружение
Чтобы зависимости Whisper не конфликтовали с чем-либо ещё в системе, рекомендуется изолированное окружение:
python3.11 -m venv whisper-env
source whisper-env/bin/activate
Шаг 4. Установите FFmpeg
Сам Whisper не декодирует аудио — он обращается к FFmpeg, который нужно ставить отдельно:
brew install ffmpeg
Шаг 5. Установите Whisper
pip install -U openai-whisper
Шаг 6. Запустите первую транскрибацию
whisper your-audio.mp3 --model turbo
Шесть шагов, три отдельных установщика и одно ограничение по версии Python, о котором нужно было знать заранее, — и всё это до того, как вы расшифровали хотя бы одно слово. И это ещё версия, в которой ничего не пошло не так.
Где застревают почти все (реальные проблемы с GitHub и StackOverflow)
Поищите проблемы с установкой «openai-whisper» — и снова и снова будут всплывать одни и те же несколько типов сбоев. Ниже — прямые цитаты из реальных отчётов, без пересказа.
«Whisper нельзя использовать на Python 3.13»
Если вы установили последнюю версию Python с python.org вместо того, чтобы зафиксировать более старую через Homebrew, установка ломается мгновенно:
Getting requirements to build wheel ... error
KeyError: '__version__'
Как прямо сказано в одном из ответов на форуме: «Whisper нельзя использовать на Python 3.13, если опираться только на выпущенные и поддерживаемые версии его цепочки зависимостей» (источник: StackOverflow). Решение — понизить версию Python и заново пересобрать виртуальное окружение с нуля, что совсем не очевидно, если вы заранее не знали о такой чувствительности Whisper к версиям.
«ffmpeg не найден» — даже после установки ffmpeg
Это одна из самых распространённых ошибок Whisper на Mac, и сбивает с толку она именно потому, что вы вроде бы всё сделали правильно:
FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'
Пользователь в этом случае уже успешно выполнил brew install ffmpeg, переустановил его и даже пробовал Python-обёртку для FFmpeg — а реальная проблема заключалась в том, что исполняемый файл FFmpeg не попадал в тот PATH, который видел Python (источник: StackOverflow). Чтобы диагностировать проблему с PATH, нужно для начала знать, что такое PATH.
На Mac нет CUDA — а большинство инструкций предполагает, что она есть
Почти в каждом руководстве по производительности Whisper упоминается CUDA — фреймворк NVIDIA для GPU. Но на Mac видеокарт NVIDIA нет. На Apple Silicon вместо этого используется MPS (Metal Performance Shaders), и в поддержке MPS в PyTorch есть реальные, задокументированные пробелы:
NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.
Это реальная ошибка родственной Whisper модели на PyTorch на Apple Silicon (источник: GitHub — huggingface/transformers #31408). Предложенный обходной путь — откатывать эту операцию на CPU, то есть замедлять обработку, чтобы починить баг, который в принципе существует только потому, что вы используете Mac.
Ошибки компилятора Rust во время установки
Whisper зависит от токенизатора tiktoken от OpenAI. Если для вашей платформы нет готового wheel-пакета, pip попытается собрать его из исходников, а для этого нужен тулчейн Rust, которого у вас, скорее всего, нет. Официальный README прямо предупреждает об этом: если установка падает с ошибкой No module named 'setuptools_rust', нужно отдельно поставить setuptools-rust, а возможно, и полноценное окружение разработки Rust. Чтобы запустить модель распознавания речи, приходится ставить компилятор.
«Быстрые» варианты требуют сборки из исходников
Обычный Whisper на PyTorch заметно медленно работает на Mac, поэтому часто советуют перейти на whisper.cpp или mlx-whisper ради настоящей скорости на Apple Silicon. Оба варианта действительно быстрее — но взамен настройки Python вы получаете настройку другого рода:
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav
Это git, тулчейн компилятора C++ и ручная загрузка файлов модели — назвать это «без программирования» язык не поворачивается. И даже после того как вы всё правильно скомпилировали, что-то ещё может пойти не так, причём так, что разобраться в причинах будет действительно тяжело. Один опытный пользователь описал, как обрабатывал пачку файлов через собранный самостоятельно бинарник whisper.cpp на Mac mini с M4: на M1 всё «работало отлично», а на M4 через пару часов вывод просто «останавливался» — без ошибок, без падений. Решением стал скрипт, который каждый час убивал и перезапускал процесс. («Whisper продолжает работать, в терминале никаких ошибок, никаких падений... просто больше нет вывода.») (источник: Ars Technica OpenForum)
Это не ошибка новичка — это опытный пользователь, которому всё равно понадобился скрипт и задача по расписанию, чтобы обойти проблему.
«Процесс установки крайне недружелюбен»
Эта жалоба, оставленная в виде issue на GitHub к инструменту на основе Whisper, хорошо резюмирует весь опыт для людей без опыта разработки: «Установщик крайне недружелюбен, постоянно прерывает загрузку больших файлов, из-за чего установка оказывается неполной, а исполняемый файл — отсутствующим... для тех, у кого нет навыков программирования, единственный вариант — удалить программу» (источник: GitHub — meizhong986/WhisperJAV #85). Решение в этой ветке снова свелось к несовпадению версий Python — незнакомый человек буквально по шагам провёл автора issue по командам в терминале, пока всё не заработало.
Даже если всё запустилось, большим моделям может не хватить памяти
Модели large-v3 для комфортной работы нужно примерно 10 ГБ видеопамяти или единой памяти. На базовом MacBook с 8 или 16 ГБ этого впритык, и процесс может попросту упасть, вынуждая переходить на меньшую и менее точную модель.
Даже если всё заработало, Whisper сам по себе — это ещё не субтитры
Допустим, вы прошли через всё вышеперечисленное и получили рабочую команду whisper your-video.mp4 --model large-v3. На выходе вы получаете расшифровку, а не субтитры — а для видео это разные задачи:
- Никакой предобработки. Whisper получает ваше аудио как есть. Если в записи фоновая музыка, эхо в комнате или шумное вступление, модель никак не понимает, что это нужно игнорировать — и хорошо задокументировано, что во время тишины или музыки она склонна к галлюцинациям: повторяет фразы, придумывает несуществующие реплики, вместо того чтобы признать неуверенность.
- Приблизительный тайминг. Встроенные временные метки Whisper округляются примерно до ближайшей секунды — для расшифровки этого достаточно, но не для субтитра, который должен появляться точно в момент, когда человек начинает говорить.
- Никакой логики переноса строк. В сыром выводе часто встречаются длинные слитные блоки текста или неудобные разрывы посреди фразы, и исправить это можно только вручную, открыв файл
.srtв текстовом редакторе. - Никакого перевода. Если нужна дорожка на другом языке, это уже совершенно отдельный инструмент и процесс.
- Никакого интерфейса редактирования. Всё происходит в командной строке. Нет ни волновой диаграммы, ни перетаскивания для подгонки, ни кнопки отмены.
Другими словами, решив проблему установки, вы не решаете проблему субтитров. Всё равно понадобится второй инструмент, чтобы превратить черновую расшифровку в то, что действительно можно опубликовать.
Самый простой способ: полностью обойти Python с помощью Subtitle Studio
Subtitle Studio использует модель того же класса, что и Whisper, но в виде нативного приложения для Mac: скачиваете, перетаскиваете видео — и получаете субтитры. Никакого терминала, никакой версии Python, никакой отладки pip install.
Редактор Subtitle Studio с волновой диаграммой, списком субтитров и превью видео, синхронизированными с речью
Помимо избавления от установки через терминал, вы получаете:
- Модель, настроенную под Apple Silicon. Модель транскрибации оптимизирована специально под чипы серии M с ускорением Metal — а не универсальная сборка PyTorch, откатывающаяся на CPU там, где MPS не поддерживает нужную операцию.
- Предобработку перед транскрибацией. Определение голосовой активности (VAD) и шумоподавление очищают аудио ещё до того, как его увидит Whisper, — из-за этого фоновая музыка и шум в помещении реже приводят к пропущенным словам и выдуманному тексту, той самой галлюцинации, за которую известен голый Whisper.
- Фильтрацию галлюцинаций. Оценка уверенности и анализ речевой активности отлавливают и убирают фантомный текст, который модель придумывает во время тишины или музыки, вместо того чтобы отправлять его прямиком в файл субтитров.
- Принудительное выравнивание. После транскрибации специальный алгоритм заново привязывает текст к волновой форме на уровне слов, заменяя округлённые до секунды метки времени Whisper таймингом с точностью до кадра.
- Сегментацию на основе NLP. Сырая расшифровка разбивается на удобочитаемые строки субтитров по естественным границам фраз, а не по произвольному числу символов.
- Встроенное редактирование. Можно перетаскиванием подогнать тайминг субтитра, разбить слишком длинную строку или объединить раздробленные — без экспорта в текстовый редактор.
Инструмент повторного выравнивания в Subtitle Studio: блок субтитра перетаскивается, чтобы совпасть с волновой диаграммой аудио
- Перевод прямо на устройстве. Готовые субтитры можно перевести на 25 языков полностью офлайн, без API-ключа и без оплаты за каждое слово — подробнее о том, как работает локальная модель, в нашем подробном разборе офлайн-перевода.
Панель перевода Subtitle Studio с выбором языка и настройками AI-провайдера
Ваши аудио и видео никогда не покидают ваш Mac — та же гарантия приватности, что и при самостоятельном запуске Whisper, только без всей возни с настройкой.
Subtitle Studio
Разовая покупка. Полностью работает офлайн на вашем Mac.
Whisper из командной строки против Subtitle Studio — сравнение
| OpenAI Whisper (CLI) | Subtitle Studio | |
|---|---|---|
| Настройка | Homebrew, управление версиями Python, виртуальное окружение, FFmpeg, pip install | Скачать приложение, открыть его |
| Нужно программировать | Да — команды в терминале, иногда отладка зависимостей | Нет |
| Ускорение на Apple Silicon | Зависит от поддержки MPS в PyTorch (есть пробелы) | Встроено, модель оптимизирована под Metal |
| Предобработка аудио | Нет — сырое аудио отправляется прямо в модель | VAD и шумоподавление перед транскрибацией |
| Обработка галлюцинаций | Нет — необработанный вывод модели | Обнаруживается и отфильтровывается автоматически |
| Точность таймингов | Точность около 1 секунды | Принудительное выравнивание на уровне слов |
| Перенос строк субтитров | Нет — нужна ручная доработка | Автоматическая сегментация на основе NLP |
| Инструменты редактирования | Текстовый редактор для экспортированного файла | Перетаскивание по волновой форме, разбиение, объединение |
| Перевод | Не включён | Встроен, офлайн, 25 языков |
| Формат вывода | .txt, .srt, .vtt | .srt, .fcpxml |
| Стоимость | Бесплатно (за счёт вашего времени) | Разовая покупка |
Вывод
Если вы разработчик и хотите встроить Whisper в свой пайплайн, пакетно обрабатывать тысячи файлов или дообучать модель самостоятельно — официальный CLI как раз для этого и создан, а затраты на настройку — это разовая плата, которую нужно внести всего один раз.
Если же вам просто нужны точные, готовые к публикации субтитры для видео без открытия терминала, путь без кода приведёт вас к цели быстрее: та же технология в основе, никакого управления окружением и набор инструментов специально для субтитров, которые в голом Whisper никогда и не планировались.
Subtitle Studio
Без Python, без Homebrew, без терминала. Просто перетащите видео.
Часто задаваемые вопросы
Нужно ли знать Python, чтобы запустить Whisper на Mac?
Чтобы пользоваться официальным пакетом openai-whisper — да: придётся установить Python, настроить виртуальное окружение и выполнять команды в терминале. Если программировать не хочется, приложения вроде Subtitle Studio используют модель того же класса, но через интерфейс перетаскивания, без единой строки кода.
Почему установка Whisper падает на моём Mac?
Самые частые причины: неподдерживаемая версия Python (сейчас установка ломается на 3.13, нужна 3.10–3.12), FFmpeg отсутствует в системном PATH даже после установки, а также отсутствие компилятора Rust, нужного для сборки зависимости tiktoken из исходников. Каждая из этих причин выдаёт свою, довольно непонятную ошибку.
Использует ли Whisper GPU моего Mac?
Может, через бэкенд MPS (Metal Performance Shaders) от Apple в PyTorch, но в поддержке операций Whisper через MPS есть задокументированные пробелы — некоторые операторы не реализованы и незаметно откатываются на более медленное выполнение на CPU. whisper.cpp и mlx-whisper в целом эффективнее используют Apple Silicon, чем оригинальный Python-пакет, но оба требуют сборки из исходников.
В чём разница между openai-whisper, whisper.cpp и mlx-whisper?
openai-whisper — это оригинальный Python-пакет от OpenAI, проще всего установить через pip, но он медленнее на Apple Silicon, поскольку работает через бэкенд MPS в PyTorch. whisper.cpp — переписанная на C++ версия, которая напрямую использует Metal и заметно быстрее, но репозиторий нужно клонировать и компилировать самостоятельно. mlx-whisper использует собственный фреймворк Apple — MLX — и часто оказывается самым быстрым вариантом на чипах серии M, но настройка такая же, из исходников. Ни один из трёх вариантов не включает предобработку аудио, редактирование субтитров или перевод — это движки транскрибации, а не инструменты для субтитров.
Есть ли бесплатный способ запустить Whisper на Mac без программирования?
Сама модель Whisper бесплатна и с открытым исходным кодом, но чтобы запустить её вообще без настройки, нужно готовое приложение, а не голая Python-библиотека, — кто-то должен взять на себя установку, управление моделью и интерфейс. Subtitle Studio — это приложение для Mac, созданное именно для этого: без терминала, без управления зависимостями, разовая покупка вместо подписки.
Subtitle Studio использует ту же модель Whisper, что и командная строка?
Subtitle Studio использует оптимизированную и дообученную модель Whisper, созданную под тот смешанный тип аудио, с которым реально работают видеооператоры и создатели контента: диалоги поверх музыки, шум в помещении, многоязычная речь — вместе с ускорением на Apple Silicon. Модель встроена в полноценный пайплайн (предобработка, фильтрация галлюцинаций, принудительное выравнивание, сегментация на основе NLP), а не работает как отдельная модель, которую вы получаете через pip install openai-whisper. Подробнее о том, как этот пайплайн влияет на реальный результат, — в нашем сравнении MacWhisper и Subtitle Studio.
Попробуйте Subtitle Studio бесплатно
Единоразовый платёж. Без подписки. Полностью офлайн на вашем Mac.

