تبدیل متن به گفتار، شبیهسازی صدا و دوبله
ElevenLabs
بهترین ابزار صدای هوش مصنوعی؛ تبدیل متن به گفتار فوقطبیعی، شبیهسازی صدا و دوبله خودکار ویدئو به دهها زبان.
Kling AI
یکی از بهترین ابزارهای متنبهویدیو و عکسبهویدیوی شرکت کوایشو؛ رئالیسم و فیزیک حرکت خیرهکننده با صدای همزمان.
HeyGen
ساخت ویدیو با آواتار AI و ترجمه/دوبله ویدیو با شبیهسازی صدا و لیپسینک؛ فارسی هم در ترجمه ویدیو رسماً پشتیبانی میشود.
Suno AI
معروفترین ابزار ساخت آهنگ کامل با هوش مصنوعی؛ از روی یک توضیح متنی یا شعر، آهنگ کامل با خواننده، ملودی و تنظیم تحویل میدهد.
OpenAI Whisper
مدل متنباز تشخیص گفتار OpenAI؛ استاندارد عملی پیادهسازی صوت به متن که فارسی را هم خوب میفهمد و رایگان روی سیستم خودتان اجرا میشود.
Gemini Notebook (NotebookLM)
دستیار پژوهش گوگل روی منابع خودتان: PDF، صوت بلند، ویدئو و لینک آپلود کنید — رونویسی/خلاصه فارسی، پادکست صوتی و تحلیل با ارجاع دقیق.
CapCut
محبوبترین ویرایشگر ویدیوی رایگان برای موبایل و دسکتاپ؛ با زیرنویس خودکار، حذف پسزمینه و هزاران قالب آماده برای ریلز و تیکتاک.
Google Flow
استودیوی فیلمسازی هوش مصنوعی گوگل با Veo 3.1: از تصاویر «مواد اولیه» صحنه بسازید، کلیپ را ادامه دهید و خروجی تا 4K بگیرید؛ جایگزین رسمی ImageFX هم شده است.
Synthesia
استاندارد صنعت برای ساخت ویدیوهای آموزشی و سازمانی با آواتار سخنگو؛ متن را مینویسید و آواتار آن را به بیش از ۱۴۰ زبان — از جمله فارسی — اجرا میکند.
Descript
ادیت ویدیو و پادکست مثل ویرایش یک سند متنی؛ رونویسی خودکار، حذف کلمات پرکننده، کلون صدا (Overdub) و صدای استودیویی با AI.
Hailuo AI
سرویس تولید ویدیوی MiniMax؛ از سریعترینها در ساخت کلیپ (۳۰ تا ۹۰ ثانیه) و مشهور به شبیهسازی واقعی فیزیک، با کلیپهای ۶ تا ۱۰ ثانیهای.
Luma Dream Machine
دریم ماشینِ Luma Labs با مدلهای سری Ray ویدیوهای سینمایی روان میسازد؛ اولین مدل ویدیویی با خروجی HDR واقعی و ابزارهای ویرایش مثل Modify و Reframe.
Runway
پیشگام تولید ویدئو با هوش مصنوعی؛ تبدیل متن و تصویر به ویدئوی سینمایی، بههمراه مجموعه کامل ابزارهای ویرایش.
Adobe Podcast
مجموعه ابزار صوتی ادوبی؛ Enhance Speech با یک کلیک نویز و اکو را حذف و کیفیت ضبط خانگی را استودیویی میکند و Mic Check تنظیم میکروفون را میسنجد.
Captions
استودیوی AI برای ویدیوهای گفتاری شبکههای اجتماعی؛ زیرنویس متحرک خودکار، ادیت هوشمند، دوبله ۳۰+ زبانه و آواتار دیجیتال در یک اپ.
Hedra
کاراکترهای سخنگو از روی یک عکس؛ مدل Character-3 در لیپسینک و احساسات چهره حرف اول را میزند و مدل جدید Omnia کنترل کامل صحنه را هم اضافه کرده است.
InVideo
سازنده ویدیوهای بازاریابی از متن؛ پرامپت یا اسکریپت میدهید و ویدیوی کامل با فوتیج استاک، گوینده AI و زیرنویس تحویل میگیرید.
Speechmatics
تبدیل گفتار به متن سازمانی با پشتیبانی زبانهای زیاد از جمله فارسی؛ ساعت رایگان برای شروع و API قوی.
Lalal.ai
شناختهشدهترین ابزار جداسازی وکال و ساز (Stem Separation)؛ آهنگ را آپلود میکنید و وکال، درام، بیس، پیانو و بقیهٔ سازها را جدا تحویل میگیرید.
Pika
پیکا (Pika Art) ابزار خوشقیمت و سرگرمکننده تولید ویدیو با مدل Pika 2.5؛ افکتهای وایرال Pikaffects و ابزارهای دستکاری ویدیوی واقعی مثل Pikadditions و Pikaswaps.
Vira
پلتفرم هوش مصنوعی ایرانی با تمرکز روی فارسی: چتبات، گفتار به متن (آوانگار)، متن به گفتار (آواشو)، تولید تصویر و OCR — با سرور داخل ایران و اپ اندروید.
Murf AI
استودیوی ساخت صدای گوینده با هوش مصنوعی؛ متن را تایپ میکنید و با صدها صدای طبیعی برای ویدئو، دورهٔ آموزشی و تبلیغ نریشن میگیرید.
Fliki AI
تبدیل متن به ویدیو با صدای گوینده مصنوعی در ۸۰+ زبان از جمله فارسی؛ برای ویدیوهای یوتیوب، آموزشی و شبکههای اجتماعی.
VN Video Editor
ویرایشگر ویدیوی رایگان و بدون واترمارک برای موبایل و مک؛ تایملاین چندلایه حرفهای با چند ابزار AI سبک مثل زیرنویس خودکار و حذف پسزمینه.
Vidu
مدل ویدیویی شرکت چینی شنگشو با قابلیت متمایز reference-to-video برای ثابت نگه داشتن شخصیتها؛ در سبک انیمه و انیمیشن بهخصوص قوی است.
Subtitle Edit
ویرایشگر رایگان و متنباز زیرنویس دسکتاپ (ویندوز/لینوکس)؛ همگامسازی، اصلاح تایمکد و ابزار کمکی OCR/صوت — نه یک چتبات، اما استاندارد حرفهای زیرنویس.
Speechify
اپ محبوب «بخوان برایم»: مقاله، PDF، ایمیل و کتاب را با صدای طبیعی و حتی صدای سلبریتیها برایتان میخواند.
PixVerse
سخاوتمندترین پلن رایگان بین ابزارهای متنبهویدیو: هر روز ۶۰ اعتبار رایگان؛ مناسب کلیپهای کوتاه تیکتاک و ریلز با لیپسینک و صدای همزمان.
Pictory AI
تبدیل مقاله و اسکریپت به ویدیو با فوتیج استاک؛ مخصوص بلاگرها و بازاریابهایی که میخواهند بدون مهارت ادیت از متن ویدیو بسازند.
VoiceMod
تغییر صدای زنده (Real-time) برای گیم و استریم؛ صدای شما را همان لحظه در دیسکورد، بازیها و تماسها عوض میکند.
Hoosha
تجمیعکننده ایرانی مدلها و ابزارهای هوش مصنوعی در یکجا؛ اعتبار بدون انقضا میخرید و فقط بهازای مصرف کسر میشود — شبیه گپجیپیتی ولی با تمرکز روی کیف پول اعتباری.
D-ID Studio
از پیشگامان فناوری «عکس سخنگو»: یک عکس پرتره و متن میدهید و ویدیوی سخنگو تحویل میگیرید؛ حالا روی ایجنتهای آواتاری تعاملی هم تمرکز کرده است.
Skybox AI
محیطهای ۳۶۰ درجه و skybox بازی را از روی یک پرامپت متنی میسازد؛ با خروجی HDRI و مش سهبعدی آماده برای Unity و Unreal.
Riffusion (ProducerAI)
ابزار ساخت موسیقی که با نام ریفیوژن شروع شد، به ProducerAI تغییر نام داد و از فوریهٔ ۲۰۲۶ متعلق به گوگل است؛ ساخت آهنگ بهصورت گفتوگویی با مدل Lyria 3.
AIVA
آهنگساز هوش مصنوعی متخصص موسیقی ارکسترال، کلاسیک و سینمایی؛ برای موسیقی متن فیلم، بازی و تیزر طراحی شده است.
TurboScribe
پیادهسازی صوت/ویدئو و ساخت زیرنویس با سرعت بالا؛ مناسب یوتیوب، مصاحبه و جلسه — خروجی SRT و ترجمه.
Soundraw
سازندهٔ موسیقی بیکلام بدون حق امتیاز (royalty-free)؛ ژانر، حس و طول را انتخاب میکنید و بینهایت قطعه برای ویدئو و پادکست میسازد.
Lumen5
تبدیل پست وبلاگ به ویدیوی برند برای بازاریابی محتوا؛ AI متن را صحنهبندی میکند و با رسانه استاک ویدیوی اجتماعی میسازد.
DeepBrain AI
پلتفرم AI Studios برای تبدیل متن به ویدیو با آواتارهای فوقواقعی؛ رقیب ارزانتر Synthesia با تولید ویدیوی نامحدود در پلن Personal.
EbSynth
ابزار دسکتاپ استایلدهی ویدیو با کیفریم: یک فریم را نقاشی میکنید و ابسینث همان سبک را به کل ویدیو تعمیم میدهد.
Swapface
اپ دسکتاپ تعویض چهره همزمان (Real-time) برای استریم و تماس تصویری؛ عکس و ویدیو را هم پوشش میدهد و همهچیز محلی روی سیستم شما پردازش میشود.
Animaker
سازنده ویدیوهای انیمیشنی و توضیحدهنده (اکسپلینر) با قالب و شخصیتهای کارتونی؛ بهعلاوه ابزار زیرنویس خودکار و ویساور AI.
DeepFaceLab
معروفترین فریمورک متنباز ساخت دیپفیک برای کاربران فنی؛ کاملاً رایگان اما نیازمند GPU قوی و ساعتها آموزش مدل.
Media.io
مجموعه آنلاین واندرشیر برای تبدیل و ویرایش ویدیو، صدا و عکس؛ از مبدل فرمت و فشردهساز تا زیرنویس خودکار، حذف نویز و آپاسکیل با AI.
TTSMaker
تبدیل متن به گفتار رایگان با پشتیبانی از بیش از ۱۰۰ زبان از جمله فارسی؛ بدون ثبتنام و با اجازهٔ استفادهٔ تجاری از خروجی.
Renderforest
پلتفرم قالبمحور برای ساخت ویدیو، لوگو، موکاپ و حتی وبسایت؛ مناسب اینترو، تیزر تبلیغاتی و هویت بصری سریع برای کسبوکارهای کوچک.
Kaiber
استودیوی خلاق موزیکویدیو و انیمیشن هنری؛ Beat Sync ویدیو را خودکار با ریتم موسیقی هماهنگ میکند.
Good Tape
سرویس پیادهسازی (ترنسکرایب) صوت به متن برای روزنامهنگارها و پژوهشگرها؛ بیش از ۱۰۰ زبان از جمله فارسی را پشتیبانی میکند.
Wisecut
ادیتور خودکار برای ویدیوهای گفتاری؛ سکوتها را میبُرد، جامپکات و زوم میسازد و زیرنویس و موسیقی پسزمینه اضافه میکند.
Capzy
زیرنویس خودکار ویدئو در کمتر از یک دقیقه، با ترجمه به ۶۰ زبان و پشتیبانی خوب از فارسی؛ خروجی SRT و استایلهای متنوع.
DreamFace
اپ محبوب موبایل و وب برای جان دادن به عکسها: چهره را سخنگو یا آوازخوان میکند، صدا کلون میکند و حتی حیوان خانگی را به حرف میآورد.
Tunebat
مرجع پیدا کردن گام (Key) و BPM آهنگها بهعلاوهٔ ابزارهای هوش مصنوعی مسترینگ و حذف وکال؛ ابزار روزمرهٔ دیجیها و تولیدکنندگان موسیقی.
Zubtitle
ابزار وب برای زیرنویسگذاری خودکار و تغییر سایز ویدیو برای شبکههای اجتماعی؛ با تیتر، پروگرسبار و قالب برند.
Vmake
مجموعه ابزار AI برای ویدیو و عکس فروشگاهی؛ از ساخت ویدیوی UGC از عکس محصول تا افزایش کیفیت تا 8K، حذف واترمارک و زیرنویس خودکار.
Eboo
ابزار ایرانی ساخت و مدیریت زیرنویس؛ مناسب تولیدکننده محتوای فارسی که پرداخت ریالی و رابط بومی میخواهد.
Avanak
سامانه ایرانی پیام صوتی، تماس و اطلاعرسانی تلفنی؛ مناسب یادآوری، اطلاعرسانی انبوه و پشتیبانی صوتی کسبوکار.
Designs.ai
مجموعه چندکاره طراحی با هوش مصنوعی: لوگوساز، ویدئوساز، طراحی گرافیک و تبدیل متن به گفتار، همه زیر یک اشتراک.
Vosk
موتور متنباز گفتار به متن آفلاین؛ مدلهای سبک برای اجرا روی دستگاه بدون ارسال صوت به ابر.
Avatarify
اپ موبایلی که عکس ثابت را زنده میکند: عکس را انتخاب میکنید، آهنگ یا صدا میدهید و پرتره شروع به خواندن یا حرفزدن میکند.
Synthesys
مجموعه آواتار و صداسازی که به یک «ایجنت ویدیویی» تبدیل شده و مدلهای روز (Sora، Veo، Kling) را پشت یک رابط ساده هماهنگ میکند؛ ارزان اما نه باکیفیتترین.
Magenta
پروژهٔ متنباز گوگل برای پژوهش موسیقی و هنر با یادگیری ماشین؛ مجموعهای از کتابخانهها، مدلها و پلاگینها برای توسعهدهندهها و موزیسینهای کنجکاو.
Wavel AI
پلتفرم دوبله، زیرنویس و صداگذاری هوش مصنوعی برای ویدئو؛ از بیش از ۱۰۰ زبان شامل فارسی برای دوبله و زیرنویس پشتیبانی میکند.
Genmo
سازنده Mochi 1، بزرگترین مدل متنبهویدیوی متنباز (Apache 2.0)؛ در playground رایگان قابل تست است یا وزنها را خودتان اجرا میکنید.
FakeYou
تبدیل متن به گفتار با صدای شخصیتهای معروف کارتون و گیم بهعلاوهٔ تبدیل صدا به صدا؛ مخصوص سرگرمی و میم.
Speakatoo
تبدیل متن به گفتار با ادعای بیش از ۱۳۰ زبان که فارسی هم بین آنهاست؛ صداهای زن و مرد فارسی با خروجی MP3.
AutoCap
اپ موبایل ساده برای زیرنویس خودکار ویدیوهای سلفی و اجتماعی؛ گفتار را متن میکند و کپشن متحرک میسازد، همراه با تلپرامپتر هوشمند.
Plotagon
اپ ساخت انیمیشنهای دیالوگمحور سهبعدی: صحنه و شخصیت را انتخاب میکنید، دیالوگ مینویسید و اپ صحنه را با صداگذاری خودکار میسازد.
Uberduck
پلتفرم TTS و وکال هوش مصنوعی که با صداهای میم و رپ معروف شد؛ حالا بیشتر روی آواز، رپ و API با صداهای دارای مجوز تمرکز دارد.
Sora
اپ مصرفی سورا متوقف شده است (آوریل ۲۰۲۶): تولید ویدئوی OpenAI که با Sora 2 استاندارد واقعگرایی را جابهجا کرد، حالا فقط تا سپتامبر ۲۰۲۶ از طریق API در دسترس است.
Rizzle
سرویس عمومی این ابزار متوقف شده است؛ ریزل که اپ ساخت ویدیوی کوتاه و تبدیل متن به ویدیو بود، از ۲۰۲۵ فقط بهصورت سازمانی برای ناشران خبری کار میکند.
MuseNet
این پروژه متوقف شده است؛ میوزنت دموی پژوهشی OpenAI برای ساخت موسیقی MIDI بود که سالهاست بازنشسته شده.
Unscreen
این سرویس متوقف شده است؛ آنسکرین ابزار محبوب حذف خودکار پسزمینه ویدیو بود که پس از خرید توسط Canva، در ۱ دسامبر ۲۰۲۵ بهکلی تعطیل شد.
Hotshot
این سرویس متوقف شده است؛ استارتاپ تولید ویدیوی Hotshot در مارس ۲۰۲۵ توسط xAI خریداری و سرویس مستقل آن تعطیل شد.
Deep Video Portraits
این پروژه متوقف شده و هرگز محصول عمومی نبود؛ دیپ ویدیو پرتریتس پژوهش SIGGRAPH 2018 برای بازسازی کامل حرکات سر و چهره در ویدیو بود.