Усі статті
Whispermacінструкціябез кодуopenaiсубтитри

Найпростіший спосіб запустити OpenAI Whisper на Mac (без жодного рядка коду)

Whisper від OpenAI безкоштовний і точний, але щоб запустити його на Mac, доведеться розібратися з Python, Homebrew, FFmpeg і купою помилок у терміналі. Ось як отримати ту саму транскрибацію без програмування.

·Tom Mong
Завантажити для Mac — безкоштовно
Найпростіший спосіб запустити OpenAI Whisper на Mac (без жодного рядка коду)

Коротка відповідь: сам Whisper від OpenAI — це не застосунок, а Python-бібліотека, яку встановлюють і запускають із терміналу. А отже, перш ніж отримати першу розшифровку, доведеться встановити Homebrew, знайти потрібну версію Python, створити віртуальне середовище, поставити FFmpeg і (майже напевно) розібратися з кількома помилками залежностей. Якщо програмувати не хочеться, найшвидший спосіб отримати таку саму приватну транскрибацію просто на пристрої — застосунок для Mac, у який Whisper уже вбудований, наприклад Subtitle Studio. Він повністю прибирає етап налаштування й додає попередню обробку та інструменти редагування, яких у голому Whisper просто немає.

Якщо ви шукали «як запустити Whisper на Mac» і натрапили на інструкцію, де до першого кроку є ще шість пунктів, а про ваш власний аудіофайл узагалі не йдеться, — вам не здалося. Далі — чому так відбувається, де саме всі застрягають і яка є альтернатива без коду.


Що таке OpenAI Whisper (і чому це не застосунок)

Whisper — це модель розпізнавання мовлення з відкритим кодом від OpenAI, випущена 2022 року й відтоді регулярно оновлювана (large-v3, turbo). Модель справді хороша: точна більш ніж у 90 мовах, безкоштовна і працює повністю на вашому власному пристрої без завантаження аудіо будь-куди. Саме тому так багато людей хочуть запустити її самостійно.

Репозиторій openai/whisper на GitHub — 106 тисяч зірок, але це репозиторій із вихідним кодом без кнопки завантаження, без інсталятора й без застосунку, який можна відкритиРепозиторій openai/whisper на GitHub — 106 тисяч зірок, але це репозиторій із вихідним кодом без кнопки завантаження, без інсталятора й без застосунку, який можна відкрити

Зверніть увагу, чого на цій сторінці немає: кнопки завантаження, інсталятора, значка застосунку. Натомість ви отримуєте папку з вихідним кодом на Python — 106 000 людей поставили репозиторію зірку, але зірка не встановлює на ваш Mac абсолютно нічого.

А GitHub-репозиторій — це дослідницький код, а не готовий продукт для кінцевого користувача. Офіційна інструкція зі встановлення передбачає, що ви впевнено вмієте:

  • встановлювати й перемикати різні версії Python;
  • користуватися pip і віртуальними середовищами;
  • читати трасування помилок Python, коли щось ламається;
  • окремо від самої моделі встановлювати системну залежність (FFmpeg).

Для дослідника в галузі машинного навчання все це цілком розумні вимоги. Але для людини, якій просто потрібні субтитри до ролика на YouTube сьогодні ввечері, — це вже чимало.


«Офіційний» спосіб запустити Whisper на Mac: крок за кроком

Треба віддати належне команді Whisper — README написаний добре. Ось що насправді потрібно, щоб пройти шлях від «нічого не встановлено» до «розшифровка на екрані».

Крок 1. Встановіть Homebrew

Якщо у вас ще немає цього неофіційного пакетного менеджера від спільноти навколо Apple, починати треба саме з нього:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Крок 2. Встановіть сумісну версію Python

Ланцюжок залежностей Whisper (numba, tiktoken, PyTorch) не підтримує найновіші релізи Python. На момент написання статті Python 3.13 ламає встановлення — потрібна версія 3.10, 3.11 або 3.12:

brew install python@3.11

Крок 3. Створіть віртуальне середовище

Щоб залежності Whisper не конфліктували з чимось іншим у системі, рекомендують ізольоване середовище:

python3.11 -m venv whisper-env
source whisper-env/bin/activate

Крок 4. Встановіть FFmpeg

Сам Whisper не декодує аудіо — він звертається до FFmpeg, який потрібно встановлювати окремо:

brew install ffmpeg

Крок 5. Встановіть Whisper

pip install -U openai-whisper

Крок 6. Запустіть першу транскрибацію

whisper your-audio.mp3 --model turbo

Шість кроків, три окремі інсталятори й одне обмеження щодо версії Python, про яке треба було знати заздалегідь, — і все це до того, як ви розшифрували бодай одне слово. І це ще версія, у якій нічого не пішло не так.


Де застрягають майже всі (реальні проблеми з GitHub і StackOverflow)

Пошукайте проблеми зі встановленням «openai-whisper» — і знову й знову спливатимуть одні й ті самі кілька типів збоїв. Нижче — прямі цитати з реальних звітів, без переказу.

«Whisper не можна використовувати на Python 3.13»

Якщо ви встановили останню версію Python із python.org замість того, щоб зафіксувати старішу через Homebrew, встановлення ламається миттєво:

Getting requirements to build wheel ... error
KeyError: '__version__'

Як прямо сказано в одній із відповідей на форумі: «Whisper не можна використовувати на Python 3.13, якщо спиратися лише на випущені й підтримувані версії його ланцюжка залежностей» (джерело: StackOverflow). Рішення — знизити версію Python і заново зібрати віртуальне середовище з нуля, що зовсім не очевидно, якщо ви заздалегідь не знали про таку чутливість Whisper до версій.

«ffmpeg не знайдено» — навіть після встановлення ffmpeg

Це одна з найпоширеніших помилок Whisper на Mac, і збиває з пантелику вона саме тому, що ви ніби зробили все правильно:

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

Користувач у цьому випадку вже успішно виконав brew install ffmpeg, перевстановив його і навіть спробував Python-обгортку для FFmpeg — а справжня проблема полягала в тому, що виконуваний файл FFmpeg не потрапляв у той PATH, який бачив Python (джерело: StackOverflow). Щоб діагностувати проблему з PATH, спершу треба знати, що таке PATH.

На Mac немає CUDA — а більшість інструкцій припускає, що вона є

Майже в кожному посібнику з продуктивності Whisper згадують CUDA — фреймворк NVIDIA для GPU. Але на Mac відеокарт NVIDIA немає. На Apple Silicon натомість використовується MPS (Metal Performance Shaders), і в підтримці MPS у PyTorch є реальні, задокументовані прогалини:

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

Це реальна помилка спорідненої з Whisper моделі на PyTorch на Apple Silicon (джерело: GitHub — huggingface/transformers #31408). Запропонований обхідний шлях — відкочувати цю операцію на CPU, тобто уповільнювати обробку, щоб полагодити баг, який узагалі існує лише тому, що ви використовуєте Mac.

Помилки компілятора Rust під час встановлення

Whisper залежить від токенізатора tiktoken від OpenAI. Якщо для вашої платформи немає готового wheel-пакета, pip спробує зібрати його з вихідного коду, а для цього потрібен тулчейн Rust, якого у вас, найімовірніше, немає. Офіційний README прямо попереджає про це: якщо встановлення падає з помилкою No module named 'setuptools_rust', потрібно окремо поставити setuptools-rust, а можливо, і повноцінне середовище розробки Rust. Щоб запустити модель розпізнавання мовлення, доводиться встановлювати компілятор.

«Швидші» варіанти вимагають збирання з вихідного коду

Звичайний Whisper на PyTorch помітно повільно працює на Mac, тому часто радять перейти на whisper.cpp або mlx-whisper заради справжньої швидкості на Apple Silicon. Обидва варіанти справді швидші — але натомість налаштування Python ви отримуєте налаштування іншого штибу:

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

Це git, тулчейн компілятора C++ і ручне завантаження файлів моделі — назвати це «без програмування» язик не повертається. І навіть коли ви все правильно скомпілювали, щось усе одно може піти не так, причому так, що розібратися в причинах буде справді важко. Один досвідчений користувач описав, як обробляв пачку файлів через самостійно зібраний бінарник whisper.cpp на Mac mini з M4: на M1 усе «працювало ідеально», а на M4 за кілька годин вивід просто «зупинявся» — без помилок, без збоїв. Рішенням став скрипт, який щогодини вбивав і перезапускав процес. («Whisper продовжує працювати, у терміналі жодних помилок, жодних збоїв... просто більше немає виводу.») (джерело: Ars Technica OpenForum)

Це не помилка новачка — це досвідчений користувач, якому все одно знадобився скрипт і завдання за розкладом, щоб обійти проблему.

«Процес встановлення вкрай недружній»

Ця скарга, залишена як issue на GitHub до інструмента на основі Whisper, добре підсумовує весь досвід для людей без досвіду розробки: «Інсталятор украй недружній, постійно перериває завантаження великих файлів, через що встановлення виявляється неповним, а виконуваний файл — відсутнім... для тих, хто не має навичок програмування, єдиний варіант — видалити програму» (джерело: GitHub — meizhong986/WhisperJAV #85). Рішення в цій гілці знову звелося до невідповідності версій Python — незнайома людина буквально крок за кроком провела автора issue по командах у терміналі, поки все не запрацювало.

Навіть якщо все запустилося, великим моделям може забракнути пам'яті

Моделі large-v3 для комфортної роботи потрібно приблизно 10 ГБ відеопам'яті або єдиної пам'яті. На базовому MacBook із 8 або 16 ГБ цього впритул, і процес може просто впасти, змушуючи переходити на меншу й менш точну модель.


Навіть якщо все запрацювало, Whisper сам собою — це ще не субтитри

Припустімо, ви пройшли крізь усе вищеперераховане і отримали робочу команду whisper your-video.mp4 --model large-v3. На виході ви отримуєте розшифровку, а не субтитри — а для відео це різні завдання:

  • Жодної попередньої обробки. Whisper отримує ваше аудіо як є. Якщо в записі фонова музика, луна в кімнаті чи галасливе вступне слово, модель ніяк не розуміє, що це треба ігнорувати — і добре задокументовано, що під час тиші чи музики вона схильна до галюцинацій: повторює фрази, вигадує неіснуючі репліки, замість того щоб визнати непевність.
  • Приблизний таймінг. Вбудовані часові мітки Whisper округлюються приблизно до найближчої секунди — для розшифровки цього достатньо, але не для субтитра, який має з'являтися точно в момент, коли людина починає говорити.
  • Жодної логіки перенесення рядків. У сирому виводі часто трапляються довгі суцільні блоки тексту або незручні розриви посеред фрази, і виправити це можна лише вручну, відкривши файл .srt у текстовому редакторі.
  • Жодного перекладу. Якщо потрібна доріжка іншою мовою, це вже зовсім окремий інструмент і процес.
  • Жодного інтерфейсу редагування. Усе відбувається в командному рядку. Немає ні хвильової діаграми, ні перетягування для підгонки, ні кнопки скасування.

Іншими словами, вирішивши проблему встановлення, ви не вирішуєте проблему субтитрів. Усе одно знадобиться другий інструмент, щоб перетворити чорнову розшифровку на те, що справді можна опублікувати.


Найпростіший спосіб: повністю оминути Python за допомогою Subtitle Studio

Subtitle Studio використовує модель того самого класу, що й Whisper, але у вигляді нативного застосунку для Mac: завантажуєте, перетягуєте відео — і отримуєте субтитри. Жодного терміналу, жодної версії Python, жодного налагодження pip install.

Редактор Subtitle Studio з хвильовою діаграмою, списком субтитрів і прев'ю відео, синхронізованими з мовленнямРедактор Subtitle Studio з хвильовою діаграмою, списком субтитрів і прев'ю відео, синхронізованими з мовленням

Крім позбавлення від встановлення через термінал, ви отримуєте:

  • Модель, налаштовану під Apple Silicon. Модель транскрибації оптимізована спеціально під чипи серії M із прискоренням Metal — а не універсальна збірка PyTorch, яка відкочується на CPU там, де MPS не підтримує потрібну операцію.
  • Попередню обробку перед транскрибацією. Виявлення голосової активності (VAD) і шумозаглушення очищають аудіо ще до того, як його побачить Whisper, — через це фонова музика та шум у приміщенні рідше призводять до пропущених слів і вигаданого тексту, тієї самої галюцинації, за яку відомий голий Whisper.
  • Фільтрацію галюцинацій. Оцінка впевненості й аналіз мовленнєвої активності відловлюють і прибирають примарний текст, який модель вигадує під час тиші чи музики, замість того щоб відправляти його прямісінько у файл субтитрів.
  • Примусове вирівнювання. Після транскрибації спеціальний алгоритм заново прив'язує текст до хвильової форми на рівні слів, замінюючи округлені до секунди мітки часу Whisper таймінгом із точністю до кадру.
  • Сегментацію на основі NLP. Сира розшифровка розбивається на зручні для читання рядки субтитрів за природними межами фраз, а не за довільною кількістю символів.
  • Вбудоване редагування. Можна перетягуванням підігнати таймінг субтитра, розбити задовгий рядок або об'єднати роздроблені — без експорту в текстовий редактор.

Інструмент повторного вирівнювання в Subtitle Studio: блок субтитра перетягується, щоб збігтися з хвильовою діаграмою аудіоІнструмент повторного вирівнювання в Subtitle Studio: блок субтитра перетягується, щоб збігтися з хвильовою діаграмою аудіо

  • Переклад прямо на пристрої. Готові субтитри можна перекласти на 25 мов повністю офлайн, без API-ключа й без оплати за кожне слово — детальніше про те, як працює локальна модель, у нашому докладному розборі офлайн-перекладу.

Панель перекладу Subtitle Studio з вибором мови та налаштуваннями AI-провайдераПанель перекладу Subtitle Studio з вибором мови та налаштуваннями AI-провайдера

Ваші аудіо та відео ніколи не залишають ваш Mac — та сама гарантія приватності, що й під час самостійного запуску Whisper, тільки без усього клопоту з налаштуванням.

Subtitle Studio

Одноразова покупка. Повністю працює офлайн на вашому Mac.


Whisper із командного рядка проти Subtitle Studio — порівняння

OpenAI Whisper (CLI)Subtitle Studio
НалаштуванняHomebrew, керування версіями Python, віртуальне середовище, FFmpeg, pip installЗавантажити застосунок, відкрити його
Потрібно програмуватиТак — команди в терміналі, іноді налагодження залежностейНі
Прискорення на Apple SiliconЗалежить від підтримки MPS у PyTorch (є прогалини)Вбудовано, модель оптимізована під Metal
Попередня обробка аудіоНемає — сире аудіо надсилається прямо в модельVAD і шумозаглушення перед транскрибацією
Обробка галюцинаційНемає — необроблений вивід моделіВиявляється й відфільтровується автоматично
Точність таймінгуТочність близько 1 секундиПримусове вирівнювання на рівні слів
Перенесення рядків субтитрівНемає — потрібне ручне доопрацюванняАвтоматична сегментація на основі NLP
Інструменти редагуванняТекстовий редактор для експортованого файлуПеретягування по хвильовій формі, розбиття, об'єднання
ПерекладНе входитьВбудовано, офлайн, 25 мов
Формат виводу.txt, .srt, .vtt.srt, .fcpxml
ВартістьБезкоштовно (за рахунок вашого часу)Одноразова покупка

Висновок

Якщо ви розробник і хочете вбудувати Whisper у свій конвеєр, пакетно обробляти тисячі файлів або дотренувати модель самостійно — офіційний CLI саме для цього й створений, а витрати на налаштування — це одноразова плата, яку треба внести лише раз.

Якщо ж вам просто потрібні точні, готові до публікації субтитри для відео без відкриття терміналу, шлях без коду приведе вас до мети швидше: та сама технологія в основі, жодного керування середовищем і набір інструментів спеціально для субтитрів, яких у голому Whisper ніколи й не планувалося.

Subtitle Studio

Без Python, без Homebrew, без терміналу. Просто перетягніть відео.


Поширені запитання

Чи потрібно знати Python, щоб запустити Whisper на Mac?

Щоб користуватися офіційним пакетом openai-whisper — так: доведеться встановити Python, налаштувати віртуальне середовище й виконувати команди в терміналі. Якщо програмувати не хочеться, застосунки на кшталт Subtitle Studio використовують модель того самого класу, але через інтерфейс перетягування, без жодного рядка коду.

Чому встановлення Whisper падає на моєму Mac?

Найчастіші причини: непідтримувана версія Python (наразі встановлення ламається на 3.13, потрібна 3.10–3.12), FFmpeg відсутній у системному PATH навіть після встановлення, а також відсутність компілятора Rust, потрібного для збирання залежності tiktoken з вихідного коду. Кожна з цих причин видає свою, доволі незрозумілу помилку.

Чи використовує Whisper GPU мого Mac?

Може, через бекенд MPS (Metal Performance Shaders) від Apple у PyTorch, але в підтримці операцій Whisper через MPS є задокументовані прогалини — деякі оператори не реалізовані й непомітно відкочуються на повільніше виконання на CPU. whisper.cpp і mlx-whisper загалом ефективніше використовують Apple Silicon, ніж оригінальний Python-пакет, але обидва потребують збирання з вихідного коду.

Яка різниця між openai-whisper, whisper.cpp і mlx-whisper?

openai-whisper — це оригінальний Python-пакет від OpenAI, найпростіше встановити через pip, але він повільніший на Apple Silicon, оскільки працює через бекенд MPS у PyTorch. whisper.cpp — переписана на C++ версія, яка напряму використовує Metal і помітно швидша, але репозиторій потрібно клонувати й компілювати самостійно. mlx-whisper використовує власний фреймворк Apple — MLX — і часто виявляється найшвидшим варіантом на чипах серії M, але налаштування таке саме, з вихідного коду. Жоден із трьох варіантів не включає попередню обробку аудіо, редагування субтитрів чи переклад — це рушії транскрибації, а не інструменти для субтитрів.

Чи є безкоштовний спосіб запустити Whisper на Mac без програмування?

Сама модель Whisper безкоштовна й з відкритим кодом, але щоб запустити її взагалі без налаштування, потрібен готовий застосунок, а не гола Python-бібліотека, — хтось має взяти на себе встановлення, керування моделлю та інтерфейс. Subtitle Studio — це застосунок для Mac, створений саме для цього: без терміналу, без керування залежностями, одноразова покупка замість підписки.

Чи використовує Subtitle Studio ту саму модель Whisper, що й командний рядок?

Subtitle Studio використовує оптимізовану й дотреновану модель Whisper, створену під той змішаний тип аудіо, з яким справді працюють відеооператори та автори контенту: діалоги поверх музики, шум у приміщенні, багатомовне мовлення — разом із прискоренням на Apple Silicon. Модель вбудована в повноцінний конвеєр (попередня обробка, фільтрація галюцинацій, примусове вирівнювання, сегментація на основі NLP), а не працює як окрема модель, яку ви отримуєте через pip install openai-whisper. Детальніше про те, як цей конвеєр впливає на реальний результат, — у нашому порівнянні MacWhisper і Subtitle Studio.

Спробуйте Subtitle Studio безкоштовно

Одноразовий платіж. Без підписки. Повністю офлайн на вашому Mac.

Завантажити для Mac — безкоштовно