সব আর্টিকেল
Whispermacটিউটোরিয়ালনো-কোডopenaiসাবটাইটেল

Mac-এ OpenAI Whisper চালানোর সবচেয়ে সহজ উপায় (কোনো কোডিং ছাড়াই)

OpenAI Whisper বিনামূল্যে ও নির্ভুল, কিন্তু Mac-এ চালাতে গেলে Python, Homebrew, FFmpeg আর একগাদা টার্মিনাল এরর সামলাতে হয়। এক লাইন কোড না লিখেই একই ট্রান্সক্রিপশন পাওয়ার উপায় এখানে।

·Tom Mong
Mac-এর জন্য ডাউনলোড করুন — ফ্রি
Mac-এ OpenAI Whisper চালানোর সবচেয়ে সহজ উপায় (কোনো কোডিং ছাড়াই)

সংক্ষিপ্ত উত্তর: OpenAI-র Whisper মডেলটা নিজে কোনো অ্যাপ নয় — এটা একটা Python লাইব্রেরি, যা টার্মিনাল থেকে ইনস্টল করে চালাতে হয়। মানে, প্রথম ট্রান্সক্রিপ্টটা হাতে পাওয়ার আগেই Homebrew, সঠিক Python ভার্সন, ভার্চুয়াল এনভায়রনমেন্ট, FFmpeg, আর (প্রায়ই) স্তূপ করা ডিপেন্ডেন্সি এরর পেরোতে হয়। আপনি যদি কোড ছুঁতে না চান, তাহলে ডিভাইসেই চলা, প্রাইভেট ট্রান্সক্রিপশন পাওয়ার সবচেয়ে দ্রুত উপায় হলো — আগে থেকেই Whisper বিল্ট-ইন থাকা একটা Mac অ্যাপ, যেমন Subtitle Studio — যা সেটআপের ঝক্কি পুরোপুরি এড়িয়ে যায় আর কাঁচা Whisper-এ না-থাকা প্রিপ্রসেসিং ও এডিটিং টুলও যোগ করে।

আপনি যদি "Mac-এ Whisper কীভাবে চালাবো" খুঁজে এমন একটা গাইডে পৌঁছান যার প্রথম ধাপ আসার আগেই ছয়টা ধাপ আছে, আর আপনার আসল অডিও ফাইলের উল্লেখই এখনো হয়নি — তাহলে এটা আপনার শুধু কল্পনা নয়। এই লেখায় দেখব কেন এমন হয়, মানুষ সাধারণত কোথায় আটকে যায়, আর কোড না লিখে কাজ করার বিকল্পটা কী।


OpenAI Whisper কী (এবং কেন এটা কোনো অ্যাপ নয়)

Whisper হলো OpenAI-র 2022 সালে প্রকাশিত, এবং তারপর থেকে ক্রমাগত আপডেট হতে থাকা (large-v3, turbo) ওপেন-সোর্স স্পিচ রিকগনিশন মডেল। এটা সত্যিই চমৎকার — 90+ ভাষায় নির্ভুল, ব্যবহার করা বিনামূল্যে, আর সম্পূর্ণভাবে আপনার নিজের মেশিনে চলে, কোথাও কোনো অডিও আপলোড না করেই। ঠিক এই কারণেই এত মানুষ এটা নিজে চালিয়ে দেখতে চান।

openai/whisper-এর GitHub রিপোজিটরি — 106k স্টার আছে, কিন্তু ডাউনলোড বাটন, ইনস্টলার, বা খোলার মতো কোনো অ্যাপ নেই এমন একটা সোর্স কোড রিপোজিটরিopenai/whisper-এর GitHub রিপোজিটরি — 106k স্টার আছে, কিন্তু ডাউনলোড বাটন, ইনস্টলার, বা খোলার মতো কোনো অ্যাপ নেই এমন একটা সোর্স কোড রিপোজিটরি

সেই পাতায় কী নেই লক্ষ্য করুন: ডাউনলোড বাটন, ইনস্টলার, অ্যাপ আইকন। আপনি পাচ্ছেন শুধু একটা Python সোর্স কোডের ফোল্ডার — 106,000 মানুষ এই রিপোজিটরিতে স্টার দিয়েছেন, কিন্তু স্টার দিলেই আপনার Mac-এ কিছু ইনস্টল হয়ে যায় না।

কিন্তু এই GitHub রিপোজিটরি একটা গবেষণা কোডবেস, ভোক্তা পণ্য নয়। অফিশিয়াল সেটআপ নির্দেশনা ধরে নেয় যে আপনি এই বিষয়গুলোতে স্বচ্ছন্দ:

  • বিভিন্ন Python ভার্সন ইনস্টল ও ম্যানেজ করা
  • pip এবং ভার্চুয়াল এনভায়রনমেন্ট ব্যবহার করা
  • কিছু ভেঙে গেলে Python ট্রেসব্যাক পড়ে বুঝে ফেলা
  • মডেল থেকে আলাদা একটা সিস্টেম ডিপেন্ডেন্সি (FFmpeg) আলাদাভাবে ইনস্টল করা

একজন মেশিন লার্নিং গবেষকের জন্য এর কোনোটাই অযৌক্তিক নয়। কিন্তু আজ রাতের মধ্যেই নিজের YouTube ভিডিওর ক্যাপশন চাওয়া কারো কাছে এটা অনেক বেশি চাওয়া।


Mac-এ Whisper চালানোর "অফিশিয়াল" উপায়, ধাপে ধাপে

Whisper টিমকে কৃতিত্ব দিতে হলে বলতে হয়, তাদের README ভালোভাবে লেখা। "কিছুই ইনস্টল নেই" থেকে "স্ক্রিনে ট্রান্সক্রিপ্ট দেখা যাচ্ছে" পর্যন্ত পৌঁছাতে আসলে কী কী লাগে, দেখা যাক।

ধাপ ১: Homebrew ইনস্টল করুন

আপনার কাছে Apple-এর এই অনানুষ্ঠানিক প্যাকেজ ম্যানেজার আগে থেকে না থাকলে, সবার আগে এটাই ইনস্টল করতে হবে:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

ধাপ ২: সামঞ্জস্যপূর্ণ Python ভার্সন ইনস্টল করুন

Whisper-এর ডিপেন্ডেন্সি চেইন (numba, tiktoken, PyTorch) সবচেয়ে নতুন Python রিলিজ সমর্থন করে না। এই লেখা লেখার সময় পর্যন্ত, Python 3.13 ইনস্টলেশন ভেঙে দেয় — আপনার লাগবে 3.10, 3.11, অথবা 3.12:

brew install python@3.11

ধাপ ৩: ভার্চুয়াল এনভায়রনমেন্ট তৈরি করুন

Whisper-এর ডিপেন্ডেন্সিগুলো সিস্টেমের অন্য কিছুর সাথে যাতে সংঘর্ষে না জড়ায়, তার জন্য সুপারিশকৃত উপায় হলো একটা আলাদা এনভায়রনমেন্ট:

python3.11 -m venv whisper-env
source whisper-env/bin/activate

ধাপ ৪: FFmpeg ইনস্টল করুন

Whisper নিজে অডিও ডিকোড করে না — এটা FFmpeg-কে ডাকে, যেটা আলাদাভাবে ইনস্টল করতে হয়:

brew install ffmpeg

ধাপ ৫: Whisper ইনস্টল করুন

pip install -U openai-whisper

ধাপ ৬: আপনার প্রথম ট্রান্সক্রিপশন চালান

whisper your-audio.mp3 --model turbo

ছয়টা ধাপ, তিনটা আলাদা ইনস্টলার, আগে থেকেই জানা থাকা দরকার এমন একটা Python ভার্সন শর্ত — আর এসবই একটা শব্দও ট্রান্সক্রাইব হওয়ার আগে। আর এটা তো সেই ভার্সন যেখানে কিছুই ভুল হয়নি।


মানুষ সাধারণত কোথায় আটকে যায় (GitHub আর StackOverflow-এর সত্যিকারের ঘটনা)

"openai-whisper" ইনস্টল সমস্যা খুঁজলে, একই কয়েকটা সমস্যা বারবার দেখা যায়। এগুলো সরাসরি আসল রিপোর্ট থেকে উদ্ধৃত, নতুন করে লেখা নয়।

"Whisper Python 3.13-এ ব্যবহার করা যায় না"

আপনি যদি Homebrew দিয়ে পুরনো ভার্সন নির্ধারণ করার বদলে python.org থেকে একদম নতুন Python ইনস্টল করেন, তাহলে ইনস্টলেশন সাথে সাথেই ব্যর্থ হয়:

Getting requirements to build wheel ... error
KeyError: '__version__'

সেই থ্রেডের একটা উত্তরে স্পষ্ট করে বলা আছে: "Whisper-এর ডিপেন্ডেন্সি চেইনের বর্তমানে প্রকাশিত, সমর্থিত ভার্সনগুলো ব্যবহার করে Python 3.13-এ Whisper ব্যবহার করা যায় না।" (সূত্র: StackOverflow) সমাধান হলো Python ভার্সন ডাউনগ্রেড করে ভার্চুয়াল এনভায়রনমেন্ট শূন্য থেকে আবার তৈরি করা — Whisper ভার্সন নিয়ে এতটা সংবেদনশীল তা আগে থেকে না জানলে এটা অনুমান করা সহজ নয়।

FFmpeg ইনস্টল করার পরও "ffmpeg not found"

এটা Mac-এ দেখা সবচেয়ে সাধারণ Whisper এররগুলোর একটা, আর এটা বিভ্রান্তিকর ঠিক এই কারণেই যে সমাধানটা আগেই কাজ করে ফেলার কথা ছিল বলে মনে হয়:

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

এই ঘটনায় ব্যবহারকারী আগেই সফলভাবে brew install ffmpeg চালিয়েছিলেন, আবার ইনস্টলও করেছিলেন, এমনকি একটা Python FFmpeg wrapper-ও চেষ্টা করেছিলেন — আসল সমস্যা ছিল FFmpeg-এর বাইনারিটা Python দেখতে পারে এমন PATH-এ ছিল না। (সূত্র: StackOverflow) PATH সমস্যা ধরতে হলে, প্রথমে জানতে হয় PATH আসলে কী।

Mac-এ CUDA নেই — কিন্তু বেশিরভাগ টিউটোরিয়াল ধরে নেয় আছে

প্রায় প্রতিটা Whisper পারফরম্যান্স গাইড CUDA-র কথা বলে, যা NVIDIA-র GPU ফ্রেমওয়ার্ক। Mac-এ NVIDIA GPU থাকে না। Apple Silicon এর বদলে ব্যবহার করে MPS (Metal Performance Shaders), এবং PyTorch-এ MPS-এর সাপোর্টে বাস্তব, নথিভুক্ত ঘাটতি আছে:

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

এটা Apple Silicon-এ Whisper-এর মতোই একটা PyTorch মডেলের আসল এরর। (সূত্র: GitHub — huggingface/transformers #31408) প্রস্তাবিত সমাধান হলো সেই অপারেশনের জন্য CPU-তে ফিরে যাওয়া — অর্থাৎ, আপনি শুধু Mac ব্যবহার করছেন বলেই থাকা একটা বাগ ঠিক করতে, ধীরগতির প্রসেসিং সহ্য করতে হয়।

ইনস্টলের সময় Rust কম্পাইলার এরর

Whisper নির্ভর করে OpenAI-র tiktoken টোকেনাইজারের উপর। আপনার প্ল্যাটফর্মের জন্য আগে থেকে বানানো wheel না থাকলে, pip সেটাকে সোর্স থেকে কম্পাইল করার চেষ্টা করে, যার জন্য আপনার কাছে সম্ভবত না-থাকা একটা Rust টুলচেইন লাগে। অফিশিয়াল README এটা সরাসরি স্বীকার করে: ইনস্টলেশন No module named 'setuptools_rust' বলে ব্যর্থ হলে, আপনাকে আলাদাভাবে setuptools-rust ইনস্টল করতে হবে, এবং হয়তো পুরো Rust ডেভেলপমেন্ট এনভায়রনমেন্ট-ও। শুধু একটা স্পিচ-টু-টেক্সট মডেল চালাতে, একটা কম্পাইলার টুলচেইন ইনস্টল করতে হয়।

"দ্রুততর" বিকল্পগুলোর জন্য সোর্স থেকে কম্পাইল করতে হয়

PyTorch-এ চলা সাধারণ Whisper Mac-এ লক্ষণীয়ভাবে ধীর, তাই সাধারণ পরামর্শ হলো আসল Apple Silicon গতির জন্য whisper.cpp বা mlx-whisper-এ চলে যাওয়া। দুটোই দ্রুত — কিন্তু দুটোই Python সেটআপের বদলে অন্য ধরনের সেটআপ দেয়:

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

এর জন্য লাগে git, একটা C++ কম্পাইলার টুলচেইন, আর মডেল ফাইলগুলো হাতে ডাউনলোড করা — একে "কোনো কোডিং ছাড়াই" বলা ঠিক হবে না। আর ঠিকভাবে কম্পাইল করার পরও, জিনিসপত্র এমনভাবে ভুল হতে পারে যা ডিবাগ করা সত্যিই কঠিন। একজন দীর্ঘদিনের ব্যবহারকারী M4 Mac mini-তে নিজের কম্পাইল করা whisper.cpp বাইনারি দিয়ে ফাইলের একটা ব্যাচ প্রসেস করার কথা বর্ণনা করেছিলেন: M1-এ এটা "একদম ঠিকঠাক চলে", কিন্তু M4-এ কয়েক ঘণ্টা পরে কোনো এরর বা ক্র্যাশ ছাড়াই আউটপুট দেওয়া "হঠাৎ থেমে যায়" — আর সমাধান ছিল প্রতি ঘণ্টায় প্রসেসটা বন্ধ করে আবার চালু করার একটা স্ক্রিপ্ট লেখা। ("Whisper চলতেই থাকে, টার্মিনালে কোনো এরর নেই, ক্র্যাশও নেই... শুধু আর কোনো আউটপুট আসে না।") (সূত্র: Ars Technica OpenForum)

এটা কোনো নতুনের ভুল নয় — এটা একজন অভিজ্ঞ ব্যবহারকারী, যাকে তবুও একটা স্ক্রিপ্ট আর cron job দিয়ে পথ বের করতে হয়েছিল।

"ইনস্টলেশন প্রক্রিয়াটা অত্যন্ত অবন্ধুসুলভ"

Whisper-ভিত্তিক একটা টুলের বিরুদ্ধে GitHub ইস্যু হিসেবে দাখিল করা এই অভিযোগটা, নন-ডেভেলপারদের পুরো অভিজ্ঞতা সুন্দরভাবে তুলে ধরে: "ইনস্টলারটা অত্যন্ত অবন্ধুসুলভ, বড় ফাইলের ডাউনলোড বারবার মাঝপথে থেমে যায়, ফলে ইনস্টলেশন অসম্পূর্ণ থেকে যায় আর একটা এক্সিকিউটেবল ফাইল হারিয়ে যায়... প্রোগ্রামিং দক্ষতা নেই এমন মানুষদের জন্য, আনইনস্টল করাই একমাত্র উপায় থাকে।" (সূত্র: GitHub — meizhong986/WhisperJAV #85) এই থ্রেডের নিজের সমাধানও, আবারও, Python ভার্সন মিল না হওয়াই ছিল — একজন অপরিচিত ব্যক্তি রিপোর্টারের সাথে টার্মিনাল কমান্ড একসাথে চালিয়ে কাজ না হওয়া পর্যন্ত সাহায্য করেছিলেন।

কাজ করলেও, বড় মডেল মেমরি শেষ করে দিতে পারে

large-v3 মডেলটা আরামে চলতে প্রায় 10 GB VRAM/ইউনিফাইড মেমরি লাগে। বেসিক 8 GB বা 16 GB MacBook-এ, এই সীমাটা এতটাই টাইট যে প্রসেসটা সরাসরি ক্র্যাশ করতে পারে, ফলে একটা ছোট, কম নির্ভুল মডেলে নেমে আসতে হয়।


চালাতে সফল হলেও, একা Whisper সাবটাইটেল নয়

ধরুন আপনি উপরের সব ঝামেলা পেরিয়ে whisper your-video.mp4 --model large-v3 মতো একটা কমান্ড সফলভাবে চালালেন। আপনি যা পান তা একটা ট্রান্সক্রিপ্ট, সাবটাইটেল নয় — আর ভিডিওর জন্য, এটা সম্পূর্ণ ভিন্ন একটা কাজ:

  • কোনো প্রিপ্রসেসিং নেই। Whisper আপনার কাঁচা অডিওটা যেমন আছে তেমনই নেয়। ব্যাকগ্রাউন্ড মিউজিক, রুমের প্রতিধ্বনি, বা হইচইপূর্ণ শুরু থাকলে, মডেলের জানা নেই যে সেটা উপেক্ষা করতে হবে — আর নীরবতা বা মিউজিকের সময় অনিশ্চয়তা স্বীকার করার বদলে এটা হ্যালুসিনেট করে (বাক্যাংশ পুনরাবৃত্তি, সংলাপ বানানো) এটা ভালোভাবেই নথিভুক্ত।
  • আনুমানিক টাইমিং। Whisper-এর বিল্ট-ইন টাইমস্ট্যাম্পগুলো প্রায় কাছাকাছি সেকেন্ডে রাউন্ড করা থাকে — ট্রান্সক্রিপ্টের জন্য ঠিক আছে, কিন্তু কেউ কথা বলা শুরু করার ঠিক সেই মুহূর্তে দেখা যাওয়া দরকার এমন ক্যাপশনের জন্য যথেষ্ট নয়।
  • কোনো লাইন-ব্রেক লজিক নেই। কাঁচা আউটপুটে লম্বা, অবিচ্ছিন্ন ব্লক বা বাক্যের মাঝখানে অস্বস্তিকর ভাঙন সাধারণ ব্যাপার, আর .srt ফাইলটা টেক্সট এডিটরে খুলে হাতে ঠিক করা ছাড়া অন্য কোনো টুল নেই।
  • কোনো অনুবাদ নেই। দ্বিতীয় ভাষার একটা ট্র্যাক দরকার হলে, সেটা সম্পূর্ণ আলাদা টুল আর ওয়ার্কফ্লো।
  • কোনো এডিটিং ইন্টারফেস নেই। সবকিছু কমান্ড লাইনেই হয়। কোনো ওয়েভফর্ম নেই, ড্র্যাগ-টু-অ্যাডজাস্ট নেই, আনডু বাটন নেই।

অর্থাৎ, ইনস্টলের সমস্যা সমাধান করলেই সাবটাইটেলের সমস্যা মিটে যায় না। আপনাকে এখনো একটা কাঁচা ট্রান্সক্রিপ্টকে সত্যিকার প্রকাশযোগ্য কিছুতে রূপান্তর করতে, একটা দ্বিতীয় টুল লাগবেই।


সবচেয়ে সহজ উপায়: Subtitle Studio দিয়ে Python সম্পূর্ণ এড়িয়ে যান

Subtitle Studio একই শ্রেণীর Whisper মডেল চালায়, কিন্তু একটা নেটিভ Mac অ্যাপ হিসেবে: ডাউনলোড করুন, আপনার ভিডিও টেনে আনুন, আর সাবটাইটেল পেয়ে যান। কোনো টার্মিনাল নেই, ম্যানেজ করার Python ভার্সন নেই, ডিবাগ করার pip install নেই।

Subtitle Studio এডিটর, ওয়েভফর্ম, সাবটাইটেল তালিকা, আর কথার সাথে মিলিয়ে রাখা ভিডিও প্রিভিউSubtitle Studio এডিটর, ওয়েভফর্ম, সাবটাইটেল তালিকা, আর কথার সাথে মিলিয়ে রাখা ভিডিও প্রিভিউ

টার্মিনাল-মুক্ত ইনস্টলের ওপরে আপনি আরও যা পান:

  • Apple Silicon-এর জন্য টিউন করা মডেল। ট্রান্সক্রিপশন মডেলটা বিশেষভাবে M-সিরিজ চিপের জন্য Metal অ্যাক্সিলারেশন সহ অপ্টিমাইজড — অসমর্থিত MPS অপারেশনের জন্য CPU-তে ফিরে যাওয়া সাধারণ কোনো PyTorch বিল্ড নয়।
  • ট্রান্সক্রিপশনের আগেই প্রিপ্রসেসিং। ভয়েস অ্যাক্টিভিটি ডিটেকশন (VAD) আর নয়েজ রিডাকশন Whisper দেখার আগেই অডিও পরিষ্কার করে দেয়, ফলে ব্যাকগ্রাউন্ড মিউজিক আর রুমের শব্দে শব্দ হারানো এবং হ্যালুসিনেটেড টেক্সট কমে যায় — এটাই তো কাঁচা Whisper-এর সুপরিচিত দুর্বলতা।
  • হ্যালুসিনেশন ফিল্টারিং। কনফিডেন্স স্কোরিং আর স্পিচ-অ্যাক্টিভিটি বিশ্লেষণ, মডেলটা নীরবতা বা মিউজিকের সময় বানানো কাল্পনিক টেক্সট ধরে ফেলে সরাসরি আপনার সাবটাইটেল ফাইলে না পাঠিয়ে সরিয়ে দেয়।
  • ফোর্সড অ্যালাইনমেন্ট। ট্রান্সক্রিপশনের পর, একটা ফোর্সড অ্যালাইনার টেক্সটকে শব্দ-স্তরে ওয়েভফর্মের সাথে আবার মেলায়, Whisper-এর ~1-সেকেন্ড-রাউন্ডেড টাইমস্ট্যাম্পের বদলে ফ্রেম-নির্ভুল টাইমিং দেয়।
  • NLP-ভিত্তিক সেগমেন্টেশন। কাঁচা ট্রান্সক্রিপ্টটা যথেচ্ছ অক্ষর সংখ্যার বদলে স্বাভাবিক বাক্যাংশের সীমানায় পড়ার উপযোগী ক্যাপশন লাইনে ভাগ করা হয়।
  • বিল্ট-ইন এডিটিং। ক্যাপশনের টাইমিং টেনে ঠিক করুন, খুব লম্বা লাইন ভাগ করুন, বা ভাঙা টুকরোগুলো জোড়া লাগান — টেক্সট এডিটরে এক্সপোর্ট না করেই।

Subtitle Studio-র রিঅ্যালাইন টুল, অডিও ওয়েভফর্মের সাথে মেলানোর জন্য টেনে নেওয়া একটা সাবটাইটেল ব্লকSubtitle Studio-র রিঅ্যালাইন টুল, অডিও ওয়েভফর্মের সাথে মেলানোর জন্য টেনে নেওয়া একটা সাবটাইটেল ব্লক

  • ডিভাইসেই অনুবাদ। আপনার তৈরি সাবটাইটেলগুলো 25টা ভাষায়, সম্পূর্ণ অফলাইনে, কোনো API কি বা প্রতি-শব্দ খরচ ছাড়াই অনুবাদ করুন — লোকাল মডেলটা কীভাবে কাজ করে জানতে আমাদের অফলাইন অনুবাদ নিয়ে গভীর আলোচনা দেখুন।

Subtitle Studio-র ট্রান্সলেট প্যানেল, ভাষা নির্বাচক আর AI প্রোভাইডার অপশনসহSubtitle Studio-র ট্রান্সলেট প্যানেল, ভাষা নির্বাচক আর AI প্রোভাইডার অপশনসহ

আপনার অডিও আর ভিডিও কখনো আপনার Mac-এর বাইরে যায় না — নিজে Whisper চালানোর মতোই প্রাইভেসির নিশ্চয়তা, শুধু সেটআপের ঝামেলা ছাড়া।

Subtitle Studio

একবারের পেমেন্ট। আপনার Mac-এ সম্পূর্ণ অফলাইনে চলে।


Whisper CLI বনাম Subtitle Studio — পাশাপাশি তুলনা

OpenAI Whisper (CLI)Subtitle Studio
সেটআপHomebrew, Python ভার্সন ম্যানেজমেন্ট, ভার্চুয়াল এনভায়রনমেন্ট, FFmpeg, pip installঅ্যাপ ডাউনলোড করুন, খুলুন
কোডিং প্রয়োজনহ্যাঁ — টার্মিনাল কমান্ড, মাঝেমধ্যে ডিপেন্ডেন্সি ডিবাগিংনা
Apple Silicon অ্যাক্সিলারেশনPyTorch-এর MPS সাপোর্টের উপর নির্ভরশীল (ঘাটতি আছে)বিল্ট-ইন, Metal-অপ্টিমাইজড মডেল
অডিও প্রিপ্রসেসিংনেই — কাঁচা অডিও সরাসরি মডেলে যায়ট্রান্সক্রিপশনের আগে VAD + নয়েজ রিডাকশন
হ্যালুসিনেশন হ্যান্ডলিংনেই — কাঁচা মডেল আউটপুটস্বয়ংক্রিয়ভাবে শনাক্ত ও ফিল্টার করা হয়
টাইমস্ট্যাম্প নির্ভুলতা~1-সেকেন্ড গ্র্যানুলারিটিশব্দ-স্তরের ফোর্সড অ্যালাইনমেন্ট
সাবটাইটেল লাইন ব্রেকিংনেই — ম্যানুয়াল পরিষ্কার করা প্রয়োজনস্বয়ংক্রিয় NLP-ভিত্তিক সেগমেন্টেশন
এডিটিং টুলএক্সপোর্ট করা ফাইলে টেক্সট এডিটরওয়েভফর্ম-ভিত্তিক রিঅ্যালাইন, স্প্লিট, মার্জ
অনুবাদঅন্তর্ভুক্ত নয়বিল্ট-ইন, অফলাইন, 25 ভাষা
আউটপুট ফরম্যাট.txt, .srt, .vtt.srt, .fcpxml
খরচবিনামূল্যে (আপনার সময়)একবারের পেমেন্ট

উপসংহার

আপনি যদি এমন একজন ডেভেলপার হন যিনি Whisper-কে একটা পাইপলাইনে স্ক্রিপ্ট করতে চান, হাজার হাজার ফাইল ব্যাচ-প্রসেস করতে চান, বা মডেলটা নিজে ফাইন-টিউন করতে চান, তাহলে অফিশিয়াল CLI-ই সঠিক টুল — সেই নমনীয়তাই এর তৈরির উদ্দেশ্য, আর সেটআপের খরচটা একবারই দিতে হয়।

আপনি যদি শুধু টার্মিনাল না খুলেই, একটা ভিডিওর জন্য নির্ভুল, প্রকাশযোগ্য সাবটাইটেল চান, তাহলে কোড-বিহীন পথটা আপনাকে সেখানে দ্রুত পৌঁছে দেয়: একই মূল প্রযুক্তি, এনভায়রনমেন্ট ম্যানেজমেন্টের কোনো ঝামেলা ছাড়াই, আর কাঁচা Whisper কখনো অন্তর্ভুক্ত করার কথা ভাবেওনি এমন সাবটাইটেল-নির্দিষ্ট টুলের একটা সেট সহ।

Subtitle Studio

না Python, না Homebrew, না টার্মিনাল। শুধু আপনার ভিডিও টেনে আনুন।


প্রায়ই জিজ্ঞাসিত প্রশ্ন

Mac-এ Whisper চালাতে কি Python জানা দরকার?

অফিশিয়াল openai-whisper প্যাকেজ ব্যবহার করতে, হ্যাঁ — আপনাকে Python ইনস্টল করতে হবে, ভার্চুয়াল এনভায়রনমেন্ট ম্যানেজ করতে হবে, আর টার্মিনাল থেকে কমান্ড চালাতে হবে। কোড ছুঁতে না চাইলে, Subtitle Studio-র মতো অ্যাপ একই শ্রেণীর মডেল ড্র্যাগ-অ্যান্ড-ড্রপ ইন্টারফেস দিয়ে, কোনো কোডিং ছাড়াই চালায়।

আমার Mac-এ Whisper ইনস্টলেশন কেন ব্যর্থ হয়?

সবচেয়ে সাধারণ কারণগুলো হলো: অসমর্থিত Python ভার্সন ব্যবহার করা (বর্তমানে 3.13 ইনস্টলেশন ভেঙে দেয়; 3.10–3.12 ব্যবহার করুন), ইনস্টল করার পরও FFmpeg সিস্টেম PATH-এ না থাকা, এবং tiktoken ডিপেন্ডেন্সি সোর্স থেকে তৈরি করতে দরকারি Rust কম্পাইলার না থাকা। এগুলোর প্রতিটা আলাদা, এবং বেশ দুর্বোধ্য এরর মেসেজ দেয়।

Whisper কি আমার Mac-এর GPU ব্যবহার করে?

করতে পারে, PyTorch-এ থাকা Apple-এর MPS (Metal Performance Shaders) ব্যাকএন্ডের মাধ্যমে, কিন্তু Whisper-এর অপারেশনের জন্য MPS সাপোর্টে নথিভুক্ত ঘাটতি আছে — কিছু অপারেটর প্রয়োগ করা হয়নি এবং চুপচাপ ধীরগতির CPU এক্সিকিউশনে ফিরে যায়। whisper.cpp আর mlx-whisper সাধারণত মূল Python প্যাকেজের চেয়ে বেশি কার্যকরভাবে Apple Silicon ব্যবহার করে, কিন্তু দুটোই সোর্স থেকে কম্পাইল করতে হয়।

openai-whisper, whisper.cpp, আর mlx-whisper-এর মধ্যে পার্থক্য কী?

openai-whisper হলো OpenAI-র মূল Python প্যাকেজ — pip দিয়ে ইনস্টল করা সবচেয়ে সহজ, কিন্তু PyTorch-এর MPS ব্যাকএন্ডের মাধ্যমে চলার কারণে Apple Silicon-এ ধীর। whisper.cpp একটা C++ পুনর্নির্মাণ যা সরাসরি Metal ব্যবহার করে এবং লক্ষণীয়ভাবে দ্রুত, কিন্তু আপনাকে রিপোজিটরি ক্লোন করে নিজে কম্পাইল করতে হয়। mlx-whisper Apple-এর নিজস্ব MLX ফ্রেমওয়ার্ক ব্যবহার করে এবং প্রায়ই M-সিরিজ চিপে সবচেয়ে দ্রুত বিকল্প, একইরকম সোর্স-থেকে-তৈরি সেটআপ সহ। এই তিনটার কোনোটাতেই অডিও প্রিপ্রসেসিং, সাবটাইটেল এডিটিং, বা অনুবাদ অন্তর্ভুক্ত নেই — এগুলো ট্রান্সক্রিপশন ইঞ্জিন, সাবটাইটেল টুল নয়।

কোডিং ছাড়া Mac-এ Whisper চালানোর কোনো বিনামূল্যের উপায় আছে কি?

Whisper মডেলটা নিজে বিনামূল্যে ও ওপেন-সোর্স, কিন্তু কোনো সেটআপ ছাড়া এটা চালাতে, কাঁচা Python লাইব্রেরির বদলে একটা প্যাকেজড অ্যাপ লাগে — কাউকে না কাউকে আপনার জন্য ইনস্টলেশন, মডেল ম্যানেজমেন্ট, আর ইন্টারফেস সামলাতে হবেই। Subtitle Studio ঠিক এই কাজের জন্যই তৈরি করা Mac অ্যাপ: কোনো টার্মিনাল নেই, ম্যানেজ করার ডিপেন্ডেন্সি নেই, সাবস্ক্রিপশনের বদলে একবারের পেমেন্ট।

Subtitle Studio কি কমান্ড লাইনের মতোই Whisper মডেল ব্যবহার করে?

Subtitle Studio ভিডিও ক্রিয়েটরদের আসল কাজে আসা মিশ্র অডিওর জন্য — মিউজিকের ওপর সংলাপ, রুমের শব্দ, আর বহুভাষিক কথা — বিশেষভাবে অপ্টিমাইজড ও ফাইন-টিউন করা Whisper মডেল ব্যবহার করে, Apple Silicon অ্যাক্সিলারেশন সহ। এটা pip install openai-whisper দিয়ে পাওয়া স্বতন্ত্র মডেলের বদলে, একটা সম্পূর্ণ পাইপলাইনে (প্রিপ্রসেসিং, হ্যালুসিনেশন ফিল্টারিং, ফোর্সড অ্যালাইনমেন্ট, NLP সেগমেন্টেশন) মোড়ানো। সেই পাইপলাইন আসল আউটপুটকে কীভাবে প্রভাবিত করে তা কাছ থেকে দেখতে, আমাদের MacWhisper বনাম Subtitle Studio তুলনা দেখুন।

Subtitle Studio ফ্রি ট্রাই করুন

একবার মাত্র পেমেন্ট, কোনো সাবস্ক্রিপশন নেই। আপনার Mac-এ সম্পূর্ণ অফলাইনে চলে।

Mac-এর জন্য ডাউনলোড করুন — ফ্রি