تبدیل متن به صدا بهصورت لوکال؛ Kokoro یا Chatterbox؟
TTS لوکال در ۲۰۲۶ از صدای رباتیک فاصله زیادی گرفته است. Kokoro با معماری 82M و مجوز Apache 2.0 برای اجرای سبک جذاب است؛ Chatterbox خانوادهای بزرگتر با voice cloning، کنترل بیان و نسخههای چندزبانه ارائه میدهد.

TTS لوکال در ۲۰۲۶ دیگر فقط انتخابی برای خواندن خشک متن نیست. مدلهای سبک و باز میتوانند narration، voice agent، راهنمای آموزشی و prototype صوتی را روی سیستم شخصی اجرا کنند؛ در سوی دیگر مدلهای بزرگتر voice cloning و کنترل بیان ارائه میدهند.
دو خانواده جذاب این فضا Kokoro و Chatterbox هستند، اما مسئله یک مسابقه «کدام بهتر است» نیست. هرکدام برای workload متفاوتی ساخته شدهاند.
TTS لوکال چرا ارزش دارد؟
در پروژه صوتی، سه چیز حساس است:
- متن منتشرنشده؛
- نمونه صدای گوینده؛
- تعداد زیاد generation.
اجرای لوکال میتواند داده را داخل سیستم نگه دارد و هزینه iteration را قابلکنترلتر کند.
برای یک ویدیوی ۳۰ دقیقهای ممکن است دهها بار جملهها را اصلاح کنید. اگر هر بار API پولی صدا زده شود، هزینه و زمان بهسرعت بالا میرود.
Kokoro؛ کوچک اما جدی
Kokoro با 82 میلیون پارامتر شناخته میشود. وزنهای آن تحت Apache 2.0 منتشر شدهاند و بهدلیل اندازه کم، برای on-device و کاربردهایی که latency مهم است جذاب است.
منبع مدل: Kokoro-82M
اندازه کوچک به معنی بیکیفیت بودن نیست؛ نکته اصلی این است که مدل برای چه زبان و چه نوع صدایی بهینه شده و voice pack موردنظر شما چقدر خوب است.
Chatterbox؛ خانوادهای برای بیان و Clone
Chatterbox پروژه Resemble AI است و در نسخههای جدید چند شکل دارد:
- Chatterbox Nano برای بودجه محاسباتی محدود؛
- Turbo برای سرعت و paralinguistic tag؛
- Multilingual V3 در اندازه 500M برای پوشش چندزبانه و voice cloning.
مخزن رسمی: Resemble AI Chatterbox
نسخههای رسمی تحت MIT منتشر شدهاند، ولی همیشه model card نسخهای را که استفاده میکنید بررسی کنید.
Voice Cloning را مسئولانه استفاده کنید
توانایی clone کردن صدا جذاب است، اما در پروژه حرفهای باید رضایت گوینده روشن باشد.
workflow سالم:
- رضایت برای استفاده از نمونه صدا؛
- تعیین کاربرد و مدت؛
- نگهداری امن reference؛
- مشخصکردن خروجی synthetic در صورت نیاز؛
- عدم استفاده خارج از قرارداد.
فناوری قویتر، مسئولیت کمتر نمیکند.
Kokoro یا Chatterbox؟
| نیاز | Kokoro | Chatterbox |
|---|---|---|
| مدل بسیار سبک | بسیار مناسب | Nano هم گزینه دارد |
| Voice cloning | تمرکز اصلی نیست | نقطه قوت |
| چندزبانه | بسته به نسخه/voice | نسخه Multilingual |
| کنترل بیان | سادهتر | گستردهتر |
| Deployment کمهزینه | جذاب | بسته به variant |
| narration هویتدار | محدودتر | مناسبتر |
بهجای انتخاب برند، task را انتخاب کنید.
Workflow حرفهای TTS
مرحله ۱: متن را برای صدا بازنویسی کنید
متن نوشتاری الزاماً متن شنیداری خوبی نیست. جملهها کوتاهتر، punctuation روشنتر و عددها خواناتر شوند.
مرحله ۲: Reference پاک
اگر voice cloning دارید، نمونه مرجع بدون موسیقی، reverb و noise تهیه کنید.
مرحله ۳: Generation کوتاه
کل مقاله را یکباره نسازید. پاراگراف یا جملههای کنترلشده تولید کنید.
مرحله ۴: QC
تلفظ اسم، عدد، acronym و کلمات خارجی بررسی شود.
مرحله ۵: Post
EQ، compression، de-esser، loudness و room tone.
چرا متن بلند را Chunk کنیم؟
TTS روی پاراگراف خیلی طولانی میتواند pacing را ناپایدار کند. chunkهای کوتاهتر امکان retake محدود میدهند.
اگر فقط جمله ۳ اشتباه است، نباید ۱۰ دقیقه صوت را دوباره تولید کنید.
نامگذاری مناسب:
- scene01_take01
- scene01_take02
- scene02_final
فارسی؛ تست واقعی لازم دارد
پشتیبانی «چندزبانه» لزوماً به معنی کیفیت یکسان فارسی نیست. بعضی مدلها زبانهای مشخصی را رسماً فهرست میکنند و فارسی ممکن است در آن لیست نباشد.
برای فارسی benchmark خودتان را بسازید:
- اعداد؛
- اسم ایرانی؛
- نیمفاصله؛
- کلمات انگلیسی داخل جمله؛
- شعر یا متن رسمی؛
- گفتار محاورهای.
اگر مدل فارسی را رسمی پشتیبانی نمیکند، مقاله یا تبلیغ شخص ثالث را جای سند رسمی نگیرید.
Watermark و Provenance
Chatterbox در خانواده خود watermark صوتی را بهعنوان ویژگی responsible AI معرفی کرده است. چنین قابلیتهایی در production ارزش دارند چون مشخص میکنند صدا generated بوده است.
اما watermark را تنها کنترل سوءاستفاده ندانید. permission و policy همچنان ضروریاند.
CPU یا GPU؟
Kokoro بهدلیل اندازه کم برای سیستمهای ضعیفتر جذاب است. Chatterbox بسته به variant میتواند از CUDA، MPS یا CPU استفاده کند؛ نمونه رسمی دستگاه موجود را تشخیص میدهد.
معیارهای benchmark:
- Real-time factor؛
- RAM/VRAM؛
- latency اولین صوت؛
- کیفیت؛
- hallucination؛
- consistency گوینده.
Voice Agent با Narration فرق دارد
برای voice agent، latency حیاتی است. برای audiobook، consistency و کیفیت بلندمدت مهمتر است.
مدل واحد ممکن است در هر دو خوب نباشد.
Agent
- جمله کوتاه؛
- پاسخ سریع؛
- streaming مطلوب.
Narration
- تلفظ پایدار؛
- لحن؛
- طولانیمدت؛
- editing آسان.
اتصال به Automation
TTS لوکال را میتوانید از API یا اسکریپت وارد workflow کنید:
- LLM متن را ساختاری کند.
- TTS هر بخش را تولید کند.
- فایلها نامگذاری شوند.
- loudness normalize شود.
- وارد timeline تدوین شوند.
برای orchestration، اتوماسیون Local AI با n8n را ببینید.
صدا را در کنار متن ذخیره کنید
برای هر فایل صوتی نسخه متن را نگه دارید. اگر بعداً فقط WAV بماند، پیدا کردن جمله و اصلاح آن سخت میشود.
یک manifest ساده:
- file؛
- text؛
- voice؛
- model version؛
- seed/config؛
- duration.
TTS لوکال و حریم خصوصی
نمونه صدای یک فرد داده حساسی است. پوشه reference را از output عمومی جدا کنید، backup رمزگذاریشده داشته باشید و دسترسی تیم را محدود کنید.
راهنمای امنیت Local AI این بخش را کاملتر بررسی میکند.
نتیجه
اگر سرعت و footprint کم مهم است، Kokoro ارزش تست جدی دارد. اگر voice cloning، بیان و چندزبانه اولویت است، خانواده Chatterbox گستره بیشتری ارائه میدهد.
انتخاب حرفهای با یک sample قشنگ انجام نمیشود؛ با benchmark روی متن واقعی پروژه، latency و QC انجام میشود.
پرسشهای متداول
Kokoro چند پارامتر دارد؟
Kokoro یک مدل TTS سبک با 82 میلیون پارامتر است و وزنهای آن با مجوز Apache 2.0 منتشر شدهاند.
Chatterbox برای voice cloning مناسب است؟
بله. خانواده رسمی Chatterbox از audio prompt برای zero-shot voice cloning استفاده میکند و نسخههای چندزبانه نیز دارد.
برای اجرای سبکتر کدام مناسبتر است؟
Kokoro بهدلیل 82M بودن بسیار سبک است. Chatterbox مدلهای Nano/Turbo و 500M چندزبانه دارد که قابلیتهای بیشتری اما هزینه محاسباتی متفاوت دارند.
آیا میتوان صدای افراد را بدون اجازه clone کرد؟
از نظر فنی ابزار ممکن است چنین قابلیتی داشته باشد، اما استفاده حرفهای باید با رضایت روشن صاحب صدا، رعایت حقوق و شفافیت انجام شود.


