PARADOXآکادمی سینما پارادوکس
هوش مصنوعی

تبدیل متن به صدا به‌صورت لوکال؛ Kokoro یا Chatterbox؟

تیم آکادمی پارادوکس۵ دقیقه مطالعه
خلاصه در یک نگاه

TTS لوکال در ۲۰۲۶ از صدای رباتیک فاصله زیادی گرفته است. Kokoro با معماری 82M و مجوز Apache 2.0 برای اجرای سبک جذاب است؛ Chatterbox خانواده‌ای بزرگ‌تر با voice cloning، کنترل بیان و نسخه‌های چندزبانه ارائه می‌دهد.

تبدیل متن به صدا با هوش مصنوعی و مدل‌های TTS

TTS لوکال در ۲۰۲۶ دیگر فقط انتخابی برای خواندن خشک متن نیست. مدل‌های سبک و باز می‌توانند narration، voice agent، راهنمای آموزشی و prototype صوتی را روی سیستم شخصی اجرا کنند؛ در سوی دیگر مدل‌های بزرگ‌تر voice cloning و کنترل بیان ارائه می‌دهند.

دو خانواده جذاب این فضا Kokoro و Chatterbox هستند، اما مسئله یک مسابقه «کدام بهتر است» نیست. هرکدام برای workload متفاوتی ساخته شده‌اند.

TTS لوکال چرا ارزش دارد؟

در پروژه صوتی، سه چیز حساس است:

  • متن منتشرنشده؛
  • نمونه صدای گوینده؛
  • تعداد زیاد generation.

اجرای لوکال می‌تواند داده را داخل سیستم نگه دارد و هزینه iteration را قابل‌کنترل‌تر کند.

برای یک ویدیوی ۳۰ دقیقه‌ای ممکن است ده‌ها بار جمله‌ها را اصلاح کنید. اگر هر بار API پولی صدا زده شود، هزینه و زمان به‌سرعت بالا می‌رود.

Kokoro؛ کوچک اما جدی

Kokoro با 82 میلیون پارامتر شناخته می‌شود. وزن‌های آن تحت Apache 2.0 منتشر شده‌اند و به‌دلیل اندازه کم، برای on-device و کاربردهایی که latency مهم است جذاب است.

منبع مدل: Kokoro-82M

اندازه کوچک به معنی بی‌کیفیت بودن نیست؛ نکته اصلی این است که مدل برای چه زبان و چه نوع صدایی بهینه شده و voice pack موردنظر شما چقدر خوب است.

Chatterbox؛ خانواده‌ای برای بیان و Clone

Chatterbox پروژه Resemble AI است و در نسخه‌های جدید چند شکل دارد:

  • Chatterbox Nano برای بودجه محاسباتی محدود؛
  • Turbo برای سرعت و paralinguistic tag؛
  • Multilingual V3 در اندازه 500M برای پوشش چندزبانه و voice cloning.

مخزن رسمی: Resemble AI Chatterbox

نسخه‌های رسمی تحت MIT منتشر شده‌اند، ولی همیشه model card نسخه‌ای را که استفاده می‌کنید بررسی کنید.

Voice Cloning را مسئولانه استفاده کنید

توانایی clone کردن صدا جذاب است، اما در پروژه حرفه‌ای باید رضایت گوینده روشن باشد.

workflow سالم:

  1. رضایت برای استفاده از نمونه صدا؛
  2. تعیین کاربرد و مدت؛
  3. نگهداری امن reference؛
  4. مشخص‌کردن خروجی synthetic در صورت نیاز؛
  5. عدم استفاده خارج از قرارداد.

فناوری قوی‌تر، مسئولیت کمتر نمی‌کند.

Kokoro یا Chatterbox؟

نیازKokoroChatterbox
مدل بسیار سبکبسیار مناسبNano هم گزینه دارد
Voice cloningتمرکز اصلی نیستنقطه قوت
چندزبانهبسته به نسخه/voiceنسخه Multilingual
کنترل بیانساده‌ترگسترده‌تر
Deployment کم‌هزینهجذاببسته به variant
narration هویت‌دارمحدودترمناسب‌تر

به‌جای انتخاب برند، task را انتخاب کنید.

Workflow حرفه‌ای TTS

مرحله ۱: متن را برای صدا بازنویسی کنید

متن نوشتاری الزاماً متن شنیداری خوبی نیست. جمله‌ها کوتاه‌تر، punctuation روشن‌تر و عددها خواناتر شوند.

مرحله ۲: Reference پاک

اگر voice cloning دارید، نمونه مرجع بدون موسیقی، reverb و noise تهیه کنید.

مرحله ۳: Generation کوتاه

کل مقاله را یک‌باره نسازید. پاراگراف یا جمله‌های کنترل‌شده تولید کنید.

مرحله ۴: QC

تلفظ اسم، عدد، acronym و کلمات خارجی بررسی شود.

مرحله ۵: Post

EQ، compression، de-esser، loudness و room tone.

چرا متن بلند را Chunk کنیم؟

TTS روی پاراگراف خیلی طولانی می‌تواند pacing را ناپایدار کند. chunkهای کوتاه‌تر امکان retake محدود می‌دهند.

اگر فقط جمله ۳ اشتباه است، نباید ۱۰ دقیقه صوت را دوباره تولید کنید.

نام‌گذاری مناسب:

  • scene01_take01
  • scene01_take02
  • scene02_final

فارسی؛ تست واقعی لازم دارد

پشتیبانی «چندزبانه» لزوماً به معنی کیفیت یکسان فارسی نیست. بعضی مدل‌ها زبان‌های مشخصی را رسماً فهرست می‌کنند و فارسی ممکن است در آن لیست نباشد.

برای فارسی benchmark خودتان را بسازید:

  • اعداد؛
  • اسم ایرانی؛
  • نیم‌فاصله؛
  • کلمات انگلیسی داخل جمله؛
  • شعر یا متن رسمی؛
  • گفتار محاوره‌ای.

اگر مدل فارسی را رسمی پشتیبانی نمی‌کند، مقاله یا تبلیغ شخص ثالث را جای سند رسمی نگیرید.

Watermark و Provenance

Chatterbox در خانواده خود watermark صوتی را به‌عنوان ویژگی responsible AI معرفی کرده است. چنین قابلیت‌هایی در production ارزش دارند چون مشخص می‌کنند صدا generated بوده است.

اما watermark را تنها کنترل سوءاستفاده ندانید. permission و policy همچنان ضروری‌اند.

CPU یا GPU؟

Kokoro به‌دلیل اندازه کم برای سیستم‌های ضعیف‌تر جذاب است. Chatterbox بسته به variant می‌تواند از CUDA، MPS یا CPU استفاده کند؛ نمونه رسمی دستگاه موجود را تشخیص می‌دهد.

معیارهای benchmark:

  • Real-time factor؛
  • RAM/VRAM؛
  • latency اولین صوت؛
  • کیفیت؛
  • hallucination؛
  • consistency گوینده.

Voice Agent با Narration فرق دارد

برای voice agent، latency حیاتی است. برای audiobook، consistency و کیفیت بلندمدت مهم‌تر است.

مدل واحد ممکن است در هر دو خوب نباشد.

Agent

  • جمله کوتاه؛
  • پاسخ سریع؛
  • streaming مطلوب.

Narration

  • تلفظ پایدار؛
  • لحن؛
  • طولانی‌مدت؛
  • editing آسان.

اتصال به Automation

TTS لوکال را می‌توانید از API یا اسکریپت وارد workflow کنید:

  1. LLM متن را ساختاری کند.
  2. TTS هر بخش را تولید کند.
  3. فایل‌ها نام‌گذاری شوند.
  4. loudness normalize شود.
  5. وارد timeline تدوین شوند.

برای orchestration، اتوماسیون Local AI با n8n را ببینید.

صدا را در کنار متن ذخیره کنید

برای هر فایل صوتی نسخه متن را نگه دارید. اگر بعداً فقط WAV بماند، پیدا کردن جمله و اصلاح آن سخت می‌شود.

یک manifest ساده:

  • file؛
  • text؛
  • voice؛
  • model version؛
  • seed/config؛
  • duration.

TTS لوکال و حریم خصوصی

نمونه صدای یک فرد داده حساسی است. پوشه reference را از output عمومی جدا کنید، backup رمزگذاری‌شده داشته باشید و دسترسی تیم را محدود کنید.

راهنمای امنیت Local AI این بخش را کامل‌تر بررسی می‌کند.

نتیجه

اگر سرعت و footprint کم مهم است، Kokoro ارزش تست جدی دارد. اگر voice cloning، بیان و چندزبانه اولویت است، خانواده Chatterbox گستره بیشتری ارائه می‌دهد.

انتخاب حرفه‌ای با یک sample قشنگ انجام نمی‌شود؛ با benchmark روی متن واقعی پروژه، latency و QC انجام می‌شود.

پرسش‌های متداول

Kokoro چند پارامتر دارد؟

Kokoro یک مدل TTS سبک با 82 میلیون پارامتر است و وزن‌های آن با مجوز Apache 2.0 منتشر شده‌اند.

Chatterbox برای voice cloning مناسب است؟

بله. خانواده رسمی Chatterbox از audio prompt برای zero-shot voice cloning استفاده می‌کند و نسخه‌های چندزبانه نیز دارد.

برای اجرای سبک‌تر کدام مناسب‌تر است؟

Kokoro به‌دلیل 82M بودن بسیار سبک است. Chatterbox مدل‌های Nano/Turbo و 500M چندزبانه دارد که قابلیت‌های بیشتری اما هزینه محاسباتی متفاوت دارند.

آیا می‌توان صدای افراد را بدون اجازه clone کرد؟

از نظر فنی ابزار ممکن است چنین قابلیتی داشته باشد، اما استفاده حرفه‌ای باید با رضایت روشن صاحب صدا، رعایت حقوق و شفافیت انجام شود.

#TTS#Kokoro#Chatterbox#هوش مصنوعی صدا#Local AI