تبدیل متن به گفتار، شبیهسازی صدا و دوبله
ElevenLabs
بهترین کیفیت متنبهگفتار و دوبله بازار — عالی ولی گران؛ برای کار حجیم مسیر Google AI Studio / OpenAI.fm + Descript ارزانتر است.
Kling AI
یکی از بهترین ابزارهای متنبهویدیو و عکسبهویدیوی شرکت کوایشو؛ رئالیسم و فیزیک حرکت خیرهکننده با صدای همزمان.
Google Flow
استودیوی فیلمسازی هوش مصنوعی گوگل با Veo 3.1: از تصاویر «مواد اولیه» صحنه بسازید، کلیپ را ادامه دهید و خروجی تا 4K بگیرید؛ جایگزین رسمی ImageFX هم شده است.
OpenAI Whisper
مدل متنباز تشخیص گفتار OpenAI؛ استاندارد عملی پیادهسازی صوت به متن که فارسی را هم خوب میفهمد و رایگان روی سیستم خودتان اجرا میشود.
Suno AI
معروفترین ابزار ساخت آهنگ کامل با هوش مصنوعی؛ از روی یک توضیح متنی یا شعر، آهنگ کامل با خواننده، ملودی و تنظیم تحویل میدهد.
CapCut
محبوبترین ویرایشگر ویدیوی رایگان برای موبایل و دسکتاپ؛ با زیرنویس خودکار، حذف پسزمینه و هزاران قالب آماده برای ریلز و تیکتاک.
Google AI Studio
محیط رایگان گوگل با Gemini: تست پرامپت، API — و یکی از بهترین مسیرهای متنبهگفتار رایگان با کمترین محدودیت (Gemini TTS / 3.1 Flash TTS).
Gemini Notebook (NotebookLM)
دستیار پژوهش گوگل با تبدیل گفتار به متن روی منابع صوتی/ویدئویی شما: آپلود کنید، رونویسی و خلاصه فارسی بگیرید + پادکست Audio Overview.
Synthesia
استاندارد صنعت برای ساخت ویدیوهای آموزشی و سازمانی با آواتار سخنگو؛ متن را مینویسید و آواتار آن را به بیش از ۱۴۰ زبان — از جمله فارسی — اجرا میکند.
Hailuo AI
سرویس تولید ویدیوی MiniMax؛ از سریعترینها در ساخت کلیپ (۳۰ تا ۹۰ ثانیه) و مشهور به شبیهسازی واقعی فیزیک، با کلیپهای ۶ تا ۱۰ ثانیهای.
Descript
جایگزین هوشمصنوعیمحور پریمیر برای دوبله/نریشن: همگذاری ویدئو، زیرنویس و صوت TTS، ویرایش متنی تایملاین و Studio Sound.
Hedra
کاراکترهای سخنگو از روی یک عکس؛ مدل Character-3 در لیپسینک و احساسات چهره حرف اول را میزند و مدل جدید Omnia کنترل کامل صحنه را هم اضافه کرده است.
Luma Dream Machine
دریم ماشینِ Luma Labs با مدلهای سری Ray ویدیوهای سینمایی روان میسازد؛ اولین مدل ویدیویی با خروجی HDR واقعی و ابزارهای ویرایش مثل Modify و Reframe.
MiniMax Audio
موتور صدای MiniMax برای تولید الگوی صدا (Voice Design)، کلون از نمونهٔ کوتاه و تبدیل متن به گفتار طبیعی Speech 2.8.
OpenAI.fm
پلیگراند رایگان و رسمی OpenAI برای متنبهگفتار (GPT-4o mini TTS): بدون ثبتنام سنگین، انتخاب صدا و «vibe»، دانلود MP3 — محدودیت بسیار کم برای تست و نریشن کوتاه.
Captions
استودیوی AI برای ویدیوهای گفتاری شبکههای اجتماعی؛ زیرنویس متحرک خودکار، ادیت هوشمند، دوبله ۳۰+ زبانه و آواتار دیجیتال در یک اپ.
Speechmatics
موتور حرفهای تبدیل گفتار به متن (STT) با پشتیبانی فارسی، حالت realtime/batch و API — مناسب زیرنویس، جلسه و محصول سازمانی.
Lalal.ai
شناختهشدهترین ابزار جداسازی وکال و ساز (Stem Separation)؛ آهنگ را آپلود میکنید و وکال، درام، بیس، پیانو و بقیهٔ سازها را جدا تحویل میگیرید.
TurboScribe
تبدیل گفتار به متن و زیرنویس با Timestamp دقیق (SRT/VTT)؛ ستون فقرات پایپلاین دوبله ارزان — استخراج متن ویدئو قبل از ترجمه و TTS.
Pika
پیکا (Pika Art) ابزار خوشقیمت و سرگرمکننده تولید ویدیو با مدل Pika 2.5؛ افکتهای وایرال Pikaffects و ابزارهای دستکاری ویدیوی واقعی مثل Pikadditions و Pikaswaps.
Runway
پیشگام تولید ویدئو با هوش مصنوعی؛ تبدیل متن و تصویر به ویدئوی سینمایی، بههمراه مجموعه کامل ابزارهای ویرایش.
Subtitle Edit
ویرایشگر رایگان زیرنویس + تبدیل صوت به متن آفلاین با موتور Vosk (و Whisper): از منوی Video → Audio to text مدل Vosk را انتخاب کنید.
Adobe Podcast
مجموعه ابزار صوتی ادوبی؛ Enhance Speech با یک کلیک نویز و اکو را حذف و کیفیت ضبط خانگی را استودیویی میکند و Mic Check تنظیم میکروفون را میسنجد.
Fliki AI
تبدیل متن به ویدیو با صدای گوینده مصنوعی در ۸۰+ زبان از جمله فارسی؛ برای ویدیوهای یوتیوب، آموزشی و شبکههای اجتماعی.
Pictory AI
تبدیل مقاله و اسکریپت به ویدیو با فوتیج استاک؛ مخصوص بلاگرها و بازاریابهایی که میخواهند بدون مهارت ادیت از متن ویدیو بسازند.
Speechify
اپ محبوب «بخوان برایم»: مقاله، PDF، ایمیل و کتاب را با صدای طبیعی و حتی صدای سلبریتیها برایتان میخواند.
livdub
افزونهٔ کروم دوبلهٔ زندهٔ صدا/ویدئوی تب فعلی به زبان دلخواه (از جمله فارسی) با کلید رایگان Gemini — بدون اکانت لیوداب.
Vidu
مدل ویدیویی شرکت چینی شنگشو با قابلیت متمایز reference-to-video برای ثابت نگه داشتن شخصیتها؛ در سبک انیمه و انیمیشن بهخصوص قوی است.
PixVerse
سخاوتمندترین پلن رایگان بین ابزارهای متنبهویدیو: هر روز ۶۰ اعتبار رایگان؛ مناسب کلیپهای کوتاه تیکتاک و ریلز با لیپسینک و صدای همزمان.
VoiceMod
تغییر صدای زنده (Real-time) برای گیم و استریم؛ صدای شما را همان لحظه در دیسکورد، بازیها و تماسها عوض میکند.
InVideo
سازنده ویدیوهای بازاریابی از متن؛ پرامپت یا اسکریپت میدهید و ویدیوی کامل با فوتیج استاک، گوینده AI و زیرنویس تحویل میگیرید.
Hoosha
تجمیعکننده ایرانی مدلها و ابزارهای هوش مصنوعی در یکجا؛ اعتبار بدون انقضا میخرید و فقط بهازای مصرف کسر میشود — شبیه گپجیپیتی ولی با تمرکز روی کیف پول اعتباری.
Vira
پلتفرم ایرانی با تأکید ویژه روی تبدیل گفتار به متن فارسی (آوانگار) + متن به گفتار (آواشو)، چت، تصویر و OCR — سرور داخل ایران.
Murf AI
استودیوی ساخت صدای گوینده با هوش مصنوعی؛ متن را تایپ میکنید و با صدها صدای طبیعی برای ویدئو، دورهٔ آموزشی و تبلیغ نریشن میگیرید.
EbSynth
ابزار دسکتاپ استایلدهی ویدیو با کیفریم: یک فریم را نقاشی میکنید و ابسینث همان سبک را به کل ویدیو تعمیم میدهد.
Nova Sharif
پلتفرم ایرانی تبدیل صوت به متن (نوا هوشمند شریف): گفتار فارسی به متن، متن به گفتار، تشخیص گوینده و API سازمانی.
Captiono
اپ ایرانی زیرنویس خودکار و ویرایش ویدئو با تمرکز روی فارسی و لهجهها؛ خروجی MP4/SRT، ترجمه، حذف نویز و پرداخت ریالی برای اینستاگرام و یوتیوب.
LOVO.ai
موتور متنبهگفتار Genny با صدها صدا و ۱۰۰+ زبان، بههمراه کلون صدا، زیرنویس خودکار و ادیتور ویدئوی آنلاین — جایگزین میانرده برای ElevenLabs.
Swapface
اپ دسکتاپ تعویض چهره همزمان (Real-time) برای استریم و تماس تصویری؛ عکس و ویدیو را هم پوشش میدهد و همهچیز محلی روی سیستم شما پردازش میشود.
Lumen5
تبدیل پست وبلاگ به ویدیوی برند برای بازاریابی محتوا؛ AI متن را صحنهبندی میکند و با رسانه استاک ویدیوی اجتماعی میسازد.
VN Video Editor
ویرایشگر ویدیوی رایگان و بدون واترمارک برای موبایل و مک؛ تایملاین چندلایه حرفهای با چند ابزار AI سبک مثل زیرنویس خودکار و حذف پسزمینه.
DeepFaceLab
معروفترین فریمورک متنباز ساخت دیپفیک برای کاربران فنی؛ کاملاً رایگان اما نیازمند GPU قوی و ساعتها آموزش مدل.
AIVA
آهنگساز هوش مصنوعی متخصص موسیقی ارکسترال، کلاسیک و سینمایی؛ برای موسیقی متن فیلم، بازی و تیزر طراحی شده است.
Skybox AI
محیطهای ۳۶۰ درجه و skybox بازی را از روی یک پرامپت متنی میسازد؛ با خروجی HDRI و مش سهبعدی آماده برای Unity و Unreal.
Renderforest
پلتفرم قالبمحور برای ساخت ویدیو، لوگو، موکاپ و حتی وبسایت؛ مناسب اینترو، تیزر تبلیغاتی و هویت بصری سریع برای کسبوکارهای کوچک.
Soundraw
سازندهٔ موسیقی بیکلام بدون حق امتیاز (royalty-free)؛ ژانر، حس و طول را انتخاب میکنید و بینهایت قطعه برای ویدئو و پادکست میسازد.
Good Tape
سرویس پیادهسازی (ترنسکرایب) صوت به متن برای روزنامهنگارها و پژوهشگرها؛ بیش از ۱۰۰ زبان از جمله فارسی را پشتیبانی میکند.
D-ID Studio
از پیشگامان فناوری «عکس سخنگو»: یک عکس پرتره و متن میدهید و ویدیوی سخنگو تحویل میگیرید؛ حالا روی ایجنتهای آواتاری تعاملی هم تمرکز کرده است.
Riffusion (ProducerAI)
ابزار ساخت موسیقی که با نام ریفیوژن شروع شد، به ProducerAI تغییر نام داد و از فوریهٔ ۲۰۲۶ متعلق به گوگل است؛ ساخت آهنگ بهصورت گفتوگویی با مدل Lyria 3.
Wisecut
ادیتور خودکار برای ویدیوهای گفتاری؛ سکوتها را میبُرد، جامپکات و زوم میسازد و زیرنویس و موسیقی پسزمینه اضافه میکند.
X-Minus Pro
جداکنندهٔ آنلاین صدای خواننده از موسیقی با مدلهای AI (مثل MDX و BS-Roformer)، کتابخانهٔ کارائوکه و تنظیم گام/تمپو.
Mynaa
پلتفرم ایرانی تولید و تقلید صدا؛ متن یا فایل صوتی را با صدای دلخواه درمیآورد، بات بله دارد و ساخت صدای سفارشی را هم میتوان سفارش داد.
DeepBrain AI
پلتفرم AI Studios برای تبدیل متن به ویدیو با آواتارهای فوقواقعی؛ رقیب ارزانتر Synthesia با تولید ویدیوی نامحدود در پلن Personal.
Mikrotakt
جدا کردن صدای خواننده از موسیقی بههمراه میکس ساقهها، تشخیص آکورد، تغییر گام/تمپو، پاکسازی صدا و مسترینگ AI.
TTSMaker
تبدیل متن به گفتار رایگان با پشتیبانی از بیش از ۱۰۰ زبان از جمله فارسی؛ بدون ثبتنام و با اجازهٔ استفادهٔ تجاری از خروجی.
Synthesys
مجموعه آواتار و صداسازی که به یک «ایجنت ویدیویی» تبدیل شده و مدلهای روز (Sora، Veo، Kling) را پشت یک رابط ساده هماهنگ میکند؛ ارزان اما نه باکیفیتترین.
DreamFace
اپ محبوب موبایل و وب برای جان دادن به عکسها: چهره را سخنگو یا آوازخوان میکند، صدا کلون میکند و حتی حیوان خانگی را به حرف میآورد.
Media.io
مجموعه آنلاین واندرشیر برای تبدیل و ویرایش ویدیو، صدا و عکس؛ از مبدل فرمت و فشردهساز تا زیرنویس خودکار، حذف نویز و آپاسکیل با AI.
Tunebat
مرجع پیدا کردن گام (Key) و BPM آهنگها بهعلاوهٔ ابزارهای هوش مصنوعی مسترینگ و حذف وکال؛ ابزار روزمرهٔ دیجیها و تولیدکنندگان موسیقی.
Avanak
سامانه ایرانی پیام صوتی، تماس و اطلاعرسانی تلفنی؛ مناسب یادآوری، اطلاعرسانی انبوه و پشتیبانی صوتی کسبوکار.
Capzy
زیرنویس خودکار ویدئو در کمتر از یک دقیقه، با ترجمه به ۶۰ زبان و پشتیبانی خوب از فارسی؛ خروجی SRT و استایلهای متنوع.
Avatarify
اپ موبایلی که عکس ثابت را زنده میکند: عکس را انتخاب میکنید، آهنگ یا صدا میدهید و پرتره شروع به خواندن یا حرفزدن میکند.
Animaker
سازنده ویدیوهای انیمیشنی و توضیحدهنده (اکسپلینر) با قالب و شخصیتهای کارتونی؛ بهعلاوه ابزار زیرنویس خودکار و ویساور AI.
Kaiber
استودیوی خلاق موزیکویدیو و انیمیشن هنری؛ Beat Sync ویدیو را خودکار با ریتم موسیقی هماهنگ میکند.
Wavel AI
پلتفرم دوبله، زیرنویس و صداگذاری هوش مصنوعی برای ویدئو؛ از بیش از ۱۰۰ زبان شامل فارسی برای دوبله و زیرنویس پشتیبانی میکند.
Vmake
مجموعه ابزار AI برای ویدیو و عکس فروشگاهی؛ از ساخت ویدیوی UGC از عکس محصول تا افزایش کیفیت تا 8K، حذف واترمارک و زیرنویس خودکار.
Designs.ai
مجموعه چندکاره طراحی با هوش مصنوعی: لوگوساز، ویدئوساز، طراحی گرافیک و تبدیل متن به گفتار، همه زیر یک اشتراک.
Magenta
پروژهٔ متنباز گوگل برای پژوهش موسیقی و هنر با یادگیری ماشین؛ مجموعهای از کتابخانهها، مدلها و پلاگینها برای توسعهدهندهها و موزیسینهای کنجکاو.
Eboo
تبدیل گفتار به متن و ساخت زیرنویس فارسی با پرداخت ریالی؛ گزینهٔ بومی کنار TurboScribe/Speechmatics برای تولیدکننده ایرانی.
Melody ML
جداکنندهٔ سادهٔ صدای خواننده از آهنگ روی مدل Demucs: وکال، درام، بیس و سازها؛ دو آهنگ رایگان بعد ۰٫۵۰ دلار هر قطعه.
Zubtitle
ابزار وب برای زیرنویسگذاری خودکار و تغییر سایز ویدیو برای شبکههای اجتماعی؛ با تیتر، پروگرسبار و قالب برند.
Vosk
موتور متنباز گفتار به متن آفلاین؛ در Subtitle Edit از مسیر Audio to text (Vosk) بدون آپلود به ابر زیرنویس میسازد.
FakeYou
تبدیل متن به گفتار با صدای شخصیتهای معروف کارتون و گیم بهعلاوهٔ تبدیل صدا به صدا؛ مخصوص سرگرمی و میم.
AutoCap
اپ موبایل ساده برای زیرنویس خودکار ویدیوهای سلفی و اجتماعی؛ گفتار را متن میکند و کپشن متحرک میسازد، همراه با تلپرامپتر هوشمند.
Genmo
سازنده Mochi 1، بزرگترین مدل متنبهویدیوی متنباز (Apache 2.0)؛ در playground رایگان قابل تست است یا وزنها را خودتان اجرا میکنید.
Speakatoo
تبدیل متن به گفتار با ادعای بیش از ۱۳۰ زبان که فارسی هم بین آنهاست؛ صداهای زن و مرد فارسی با خروجی MP3.
Plotagon
اپ ساخت انیمیشنهای دیالوگمحور سهبعدی: صحنه و شخصیت را انتخاب میکنید، دیالوگ مینویسید و اپ صحنه را با صداگذاری خودکار میسازد.
Uberduck
پلتفرم TTS و وکال هوش مصنوعی که با صداهای میم و رپ معروف شد؛ حالا بیشتر روی آواز، رپ و API با صداهای دارای مجوز تمرکز دارد.
Sora
اپ مصرفی سورا متوقف شده است (آوریل ۲۰۲۶): تولید ویدئوی OpenAI که با Sora 2 استاندارد واقعگرایی را جابهجا کرد، حالا فقط تا سپتامبر ۲۰۲۶ از طریق API در دسترس است.
Rizzle
سرویس عمومی این ابزار متوقف شده است؛ ریزل که اپ ساخت ویدیوی کوتاه و تبدیل متن به ویدیو بود، از ۲۰۲۵ فقط بهصورت سازمانی برای ناشران خبری کار میکند.
MuseNet
این پروژه متوقف شده است؛ میوزنت دموی پژوهشی OpenAI برای ساخت موسیقی MIDI بود که سالهاست بازنشسته شده.
Unscreen
این سرویس متوقف شده است؛ آنسکرین ابزار محبوب حذف خودکار پسزمینه ویدیو بود که پس از خرید توسط Canva، در ۱ دسامبر ۲۰۲۵ بهکلی تعطیل شد.
Hotshot
این سرویس متوقف شده است؛ استارتاپ تولید ویدیوی Hotshot در مارس ۲۰۲۵ توسط xAI خریداری و سرویس مستقل آن تعطیل شد.