تبدیل متن به صدا با هوش مصنوعی در سال ۲۰۲۶ دیگر آن صدای رباتیک و بیروح چند سال پیش نیست. مدلهایی مثل ElevenLabs (الون لبز) و OpenAI TTS حالا میتوانند یک متن فارسی را با لحن، مکث و احساس طبیعی بخوانند، صدای شما را با رضایت خودتان کلون کنند و حتی افکت صوتی و موسیقی بسازند. در این راهنما یاد میگیرید کدام مدل برای تبدیل متن به گفتار فارسی مناسبتر است، متن را چطور آماده کنید که درست خوانده شود و چطور در چند دقیقه در استودیوی صدای هوشی خروجی حرفهای بگیرید.
تبدیل متن به صدا چیست و چطور کار میکند؟
تبدیل متن به صدا (Text-to-Speech یا TTS) یعنی یک مدل هوش مصنوعی متن نوشتاری را میگیرد و فایل صوتی گفتار انسانی تحویل میدهد. نسل جدید این مدلها بهجای چسباندن تکههای صدای ضبطشده، کل جمله را «میفهمند» و آهنگ و تأکید را از روی معنا حدس میزنند.
مدلهای قدیمی (مثل سامانههای مبتنی بر قاعده) هر واج را جدا تولید میکردند و نتیجه یکنواخت بود. مدلهای عصبی امروزی روی ساعتها گفتار واقعی آموزش دیدهاند و سه کار را همزمان انجام میدهند:
تحلیل متن: تشخیص زبان، تلفظ کلمات، اعداد و علائم نگارشی.
پیشبینی نوای گفتار (Prosody): کجا مکث شود، کدام کلمه تأکید بگیرد، جمله پرسشی است یا خبری.
ساخت موج صوتی: تولید صدای نهایی با رنگ و حالوهوای «صدای» انتخابشده.
نکتهی مهم برای فارسیزبانها این است که خط فارسی معمولاً بدون اعراب نوشته میشود؛ پس مدل باید از روی بافت جمله بفهمد «کرد» را کَرد بخواند یا کُرد. همینجاست که کیفیت مدل و آمادهسازی متن، تفاوت اصلی را میسازد.
بهترین مدلهای تبدیل متن به گفتار فارسی در ۲۰۲۶
پاسخ کوتاه: برای کیفیت و احساس، Eleven v4 از ElevenLabs انتخاب اول است؛ برای کارهای زنده و کمتأخیر Eleven v4 Turbo یا Flash v2.5؛ و برای هزینهی پایین و کنترل با دستور متنی، GPT-4o mini TTS از OpenAI.
الون لبز در ۲۸ سپتامبر ۲۰۲۶ (۶ مهر ۱۴۰۵) دو مدل Eleven v4 و Eleven v4 Turbo را معرفی کرد. طبق اعلام این شرکت، v4 از بیش از ۹۰ زبان پشتیبانی میکند (در نسل قبل حدود ۷۰ زبان بود)، تگهای احساسی درونمتنی مثل [softly] و [laughs] را میفهمد و گفتوگوی چندگویندهای میسازد. فارسی هم در فهرست زبانهای پشتیبانیشده است.
OpenAI هم سه مدل گفتار دارد: gpt-4o-mini-tts (جدیدترین و قابلهدایت با دستور متنی)، tts-1 و tts-1-hd. طبق مستندات رسمی، ۱۳ صدای آماده دارد و بیش از ۵۰ زبان را پوشش میدهد، هرچند صداها برای انگلیسی بهینه شدهاند. جمنای هم مدل Gemini 3.8 Flash TTS را با قیمت توکنی عرضه کرده است.
مقایسهی مدلهای اصلی تبدیل متن به صدا (قیمتهای دلاری فهرست رسمی، مهر ۱۴۰۵)
مدل
نقطهی قوت
مناسب برای
قیمت پایه
Eleven v4
بیشترین احساس، تگهای احساسی، چندگوینده
کتاب صوتی، تیزر، دوبله
۰٫۰۸ دلار / ۱۰۰۰ کاراکتر
Eleven v4 Turbo
سرعت بالا با کیفیت نزدیک به v4
دستیار صوتی، پاسخگوی تلفنی
۰٫۰۴ دلار / ۱۰۰۰ کاراکتر
Eleven Multilingual v2
پایدار و آزموده برای متنهای بلند
پادکست، روایت
۰٫۰۸ دلار / ۱۰۰۰ کاراکتر
Eleven Flash v2.5
کمترین تأخیر
اپلیکیشنهای بلادرنگ
۰٫۰۴ دلار / ۱۰۰۰ کاراکتر
GPT-4o mini TTS
کنترل لحن با دستور متنی، ارزان
اعلانها، محتوای حجیم
۰٫۶ دلار ورودی و ۱۲ دلار خروجی / ۱M توکن
Gemini 3.8 Flash TTS
قیمت توکنی رقابتی
توسعهدهندهها، کارهای انبوه
۰٫۵ دلار ورودی و ۹ دلار خروجی / ۱M توکن
توجه: قیمتها دلاری و برای مقایسهاند. ElevenLabs تا ۱۲ اکتبر ۲۰۲۶ تخفیف معرفی برای v4 دارد. قیمت تومانی و بهروز هر مدل را در صفحهی مدلها و قیمتها ببینید.
کیفیت فارسی از نگاه تجربهی عملی
آمار رسمی و مستقلی از کیفیت فارسی این مدلها منتشر نشده است؛ آنچه در ادامه میآید جمعبندی تجربهی کار با متنهای فارسی است، نه بنچمارک. Eleven v4 و Multilingual v2 معمولاً طبیعیترین آهنگ جمله را دارند و کمتر کلمهی فارسی را با لهجهی خارجی میخوانند. GPT-4o mini TTS در جملههای ساده خوب است ولی گاهی تلفظ کلمات کمکاربرد یا اسمهای خاص را اشتباه میکند. توصیهی ما ساده است: همان پاراگراف را با دو یا سه مدل بسازید و با گوش خودتان انتخاب کنید.
برای آزمون منصفانه، از یک متن محک استفاده کنید که چالشهای رایج فارسی را داشته باشد: یک عدد و تاریخ، یک کلمهی دوپهلو، یک اسم خاص خارجی، یک جملهی پرسشی و یک جملهی بلند با چند ویرگول. اگر مدلی همهی اینها را درست خواند، برای بیشتر پروژهها کافی است. لحن هم مهم است: صدایی که برای تیزر تبلیغاتی عالی است، ممکن است برای کتاب صوتی یکساعته خستهکننده باشد. پس صدا را با توجه به مخاطب و طول محتوا انتخاب کنید.
با تبدیل متن به صدا میتوانید بدون استودیوی گران، پادکست و روایت صوتی تولید کنید.
۸ نکته برای تبدیل متن به گفتار فارسی با کیفیت بالا
بیشترِ خطاهای تلفظ در فارسی از خودِ متن میآید، نه از مدل. اگر متن را قبل از تبدیل تمیز کنید، کیفیت خروجی بهطور محسوسی بهتر میشود.
نیمفاصله را رعایت کنید. «میشود» با نیمفاصله یک کلمه است؛ «میشود» یا «میشود» ممکن است مدل را گیج کند و مکث بیجا بسازد. همینطور «کتابها»، «هوشهای مصنوعی» و «بزرگتر».
علائم نگارشی را درست بگذارید. ویرگول (،) مکث کوتاه، نقطه مکث کامل و علامت سؤال آهنگ پرسشی میسازد. جملهی بدون نقطهگذاری یکنفس و خستهکننده خوانده میشود.
اعداد مهم را با حروف بنویسید. «۱۴۰۵» ممکن است «یک، چهار، صفر، پنج» یا «هزار و چهارصد و پنج» خوانده شود. برای سال، مبلغ و شماره تلفن، خودتان شکل خواندنی را بنویسید: «سال هزار و چهارصد و پنج».
کلمههای دوپهلو را اعراب بگذارید. برای «مُهر/مِهر»، «کُشتی/کِشتی» یا «سَحَر/سِحر» یک اعراب کوچک کافی است.
مخففها را باز کنید. «ج.ا.ا» یا «ق.ظ» را کامل بنویسید. مخففهای لاتین مثل AI را اگر میخواهید «ایآی» خوانده شود، فارسی بنویسید.
اسمهای خاص خارجی را آزمایش کنید. گاهی نوشتن «اِلِونلَبز» نتیجهی بهتری از «ElevenLabs» میدهد.
متن بلند را بخشبندی کنید. هر پاراگراف را جدا بسازید تا اگر جایی ایراد داشت، فقط همان بخش را دوباره تولید کنید.
از تگهای احساسی کم و بهجا استفاده کنید. در Eleven v4 میتوانید پیش از جمله بنویسید [softly] یا [excited]. زیادهروی، صدا را اغراقآمیز میکند.
پرامپت نمونه برای آمادهسازی متن
این متن را برای تبدیل به صدای فارسی آماده کن: نیمفاصلهها را اصلاح کن، اعداد را به حروف بنویس، مخففها را باز کن، جملههای بلندتر از ۲۵ کلمه را بشکن و روی کلمات دوپهلو اعراب بگذار. معنی متن را تغییر نده. متن: «…»
این پرامپت را میتوانید در پنل چت هوشی به Claude Sonnet 5.5 یا GPT-5.5 بدهید و خروجی را مستقیم در استودیوی صدا بچسبانید. برای نوشتن پرامپتهای بهتر، راهنمای مهندسی پرامپت را هم ببینید.
کلون صدا: امکانات، کاربردها و اخلاق رضایت
کلون صدا یعنی ساختن نسخهی دیجیتال صدای یک فرد از روی نمونهی ضبطشده. طبق اعلام ElevenLabs، مدلهای v4 میتوانند از حدود ۱۰ ثانیه صدا یک کلون فوری بسازند و حتی صدای شما را در زبان دیگری با لهجهی بومی آن زبان بازتولید کنند.
دو نوع کلون رایج است:
کلون فوری (Instant): با نمونهی کوتاه ساخته میشود؛ سریع است ولی شباهت کامل ندارد.
کلون حرفهای (Professional): با دهها دقیقه صدای تمیز آموزش میبیند و شباهت بسیار بالایی دارد. ElevenLabs برای این نوع، مرحلهی تأیید هویت صوتی (Voice CAPTCHA) دارد و فقط اجازه میدهد صدای خودتان را کلون کنید.
کلون صدا فقط با رضایت صریح صاحب صدا اخلاقی و مجاز است.
هشدار: ساختن صدای دیگران بدون اجازه، حتی برای شوخی، میتواند مصداق جعل هویت و کلاهبرداری باشد. سیاست استفادهی ElevenLabs صراحتاً تقلید صدای افراد بدون رضایت یا حق قانونی را ممنوع کرده و OpenAI هم الزام میکند به شنونده گفته شود صدایی که میشنود ساختهی هوش مصنوعی است.
چند قاعدهی ساده برای استفادهی مسئولانه:
فقط صدای خودتان یا کسی را کلون کنید که رضایت کتبی و مشخص داده است (برای چه پروژهای، تا کی، در چه رسانهای).
در توضیح ویدیو یا پادکست بنویسید که بخشی از صدا با هوش مصنوعی ساخته شده است.
صدای چهرههای مشهور، سیاستمداران یا افراد درگذشته را بدون مجوز قانونی بازسازی نکنید.
به خانواده و همکارانتان یاد بدهید که برای تماسهای مشکوک درخواست پول، «کلمهی رمز خانوادگی» داشته باشند؛ کلاهبرداری با صدای جعلی واقعی است.
ساخت افکت صوتی و موسیقی با هوش مصنوعی
علاوه بر گفتار، میتوانید با یک توصیف متنی افکت صوتی (صدای باران، قدم روی برف، شلوغی بازار) یا قطعهی موسیقی کامل بسازید. ElevenLabs برای این کار مدلهای Sound Effects v2 و Eleven Music را عرضه کرده است.
طبق اعلام الون لبز، Eleven Music فقط روی دادهی موسیقی دارای مجوز آموزش دیده و خروجی آن برای بیشتر کاربردهای تجاری مثل پادکست، تبلیغ و شبکههای اجتماعی مجاز است؛ هرچند در پلنهای غیرسازمانی، استفاده در فیلم سینمایی، تلویزیون و بازیهای استودیویی استثنا شده است. پیش از انتشار تجاری، شرایط پلن خود را بخوانید.
Gentle rain on a tin roof at night, distant thunder, a teapot whistling softly indoors, calm and cozy, 15 seconds
پرامپت افکت و موسیقی را بهتر است انگلیسی بنویسید؛ مدلها روی توصیفهای انگلیسی دقیقتر عمل میکنند. برای حالوهوای ایرانی هم میتوانید سازها را نام ببرید: santur, tar, daf.
کاربردهای عملی: پادکست، دوبله، آموزش و کسبوکار
تبدیل متن به صدا برای هر کسی که محتوای صوتی لازم دارد ولی وقت، استودیو یا گویندهی حرفهای ندارد، صرفهجویی جدی است. چند کاربرد پرتکرار:
+۹۰زبان در Eleven v4
۱۳صدای آماده در API گفتار OpenAI
~۱۰ ثانیهنمونهی لازم برای کلون فوری v4
۱۰٬۰۰۰کاراکتر در هر درخواست Eleven v4
پادکست و کتاب صوتی
متن اپیزود را بنویسید، برای هر گوینده یک صدا انتخاب کنید و بخشها را جدا بسازید. با قابلیت چندگویندهی Eleven v4 میتوانید گفتوگوی دو نفره هم بسازید. برای کتاب صوتی، اول حق نشر متن را بررسی کنید.
دوبله و زیرنویس صوتی
زنجیرهی معمول این است: گفتار اصلی را با Scribe یا GPT Transcribe به متن تبدیل کنید، با یک مدل زبانی مثل Claude ترجمهی روان فارسی بگیرید، و بعد متن ترجمه را به صدا تبدیل کنید. اگر صاحب صدا رضایت داده باشد، میتوانید با صدای کلونشدهی خودش دوبله کنید.
آموزش، دسترسپذیری و کسبوکار
معلمها و دورهسازها: تبدیل جزوه به فایل صوتی برای مرور در مسیر.
دسترسپذیری: نسخهی شنیداری مقالهها برای افراد کمبینا.
اگر میخواهید تبدیل متن به صدا را داخل اپلیکیشن، ربات تلگرام یا سامانهی تلفنی خودتان بگذارید، باید از API استفاده کنید. هوشی هم API یکپارچهی سازگار با OpenAI (مسیر /v1/audio/speech) دارد و هم API بومی ElevenLabs روی https://api.hooshi.ai/elevenlabs که با SDK رسمی الون لبز و فقط با عوضکردن آدرس و کلید کار میکند.
چند نکتهی فنی که در عمل مهم است:
استریم صدا: برای دستیارهای صوتی، صدا را بهصورت جریانی (Streaming) بگیرید تا پخش قبل از پایان تولید شروع شود. مدلهای Turbo و Flash برای همین ساخته شدهاند.
کشکردن خروجی: جملههای ثابت مثل «لطفاً منتظر بمانید» را یکبار بسازید و فایلش را ذخیره کنید؛ هر بار تولید دوباره یعنی هزینهی دوباره.
فرمت مناسب: برای وب MP3 یا Opus، برای پردازش بعدی WAV یا PCM.
یکسان ماندن صدا: شناسهی صدا (Voice ID) و تنظیمات پایداری را در کد ثابت نگه دارید تا همهی فایلها یکدست باشند.
اطلاع به کاربر: طبق سیاست OpenAI، به شنونده بگویید صدایی که میشنود ساختهی هوش مصنوعی است.
تبدیل متن به صدا با هوش مصنوعی سریع و ارزان است، اما جای گویندهی حرفهای را در همهی پروژهها نمیگیرد.
مزایا
تولید در چند ثانیه بهجای جلسهی ضبط
هزینهی بسیار کمتر از استودیو و گوینده
اصلاح آسان؛ کافی است متن را عوض کنید
دهها زبان و صدا از یک ابزار
معایب
اشتباه تلفظ در اسمهای خاص و کلمات دوپهلو
احساس در متنهای ادبی و شعر هنوز کامل نیست
خطر سوءاستفاده از کلون صدا
محدودیت مجوز تجاری در برخی پلنها
برای برآورد هزینه: یک متن ۱۰۰۰ کلمهای فارسی حدود ۵ تا ۶ هزار کاراکتر است. با قیمت پایهی Eleven v4 (۰٫۰۸ دلار برای هر هزار کاراکتر) این یعنی کمتر از نیم دلار؛ با مدلهای Turbo و Flash نصف این مقدار. معادل تومانی را در صفحهی پلنها و فهرست مدلها ببینید.
جمعبندی
اگر میخواهید متن فارسی را به صدای طبیعی تبدیل کنید، با Eleven v4 شروع کنید، متن را قبل از تبدیل تمیز کنید و چند صدا را مقایسه کنید. برای کلون صدا فقط با رضایت کار کنید و به مخاطب بگویید صدا ساختهی هوش مصنوعی است. اگر به تولید تصویر برای همان ویدیو یا پادکست هم نیاز دارید، راهنمای ساخت عکس با هوش مصنوعی را بخوانید.
سوالات متداول
بهترین هوش مصنوعی برای تبدیل متن به صدای فارسی کدام است؟
+
در مهر ۱۴۰۵، Eleven v4 از ElevenLabs طبیعیترین خروجی فارسی را با کنترل احساس و چندگوینده ارائه میکند. اگر سرعت مهمتر است، Eleven v4 Turbo یا Flash v2.5 و اگر هزینه اولویت دارد، GPT-4o mini TTS گزینههای خوبیاند. بهترین روش این است که یک پاراگراف یکسان را با دو یا سه مدل بسازید و با گوش خودتان مقایسه کنید.
آیا تبدیل متن به صدا در هوشی رایگان است؟
+
هوشی پلن رایگان دارد که برای امتحانکردن استودیوی صدا و ساخت متنهای کوتاه کافی است. برای حجم بیشتر یا مدلهای گرانتر مثل Eleven v4 باید یکی از پلنهای ماهانهی تومانی را تهیه کنید. جزئیات سهمیهی هر پلن در صفحهی پلنها و قیمت بهروز هر مدل در صفحهی مدلها آمده است.
چرا هوش مصنوعی بعضی کلمات فارسی را اشتباه میخواند؟
+
خط فارسی معمولاً بدون اعراب نوشته میشود و مدل باید تلفظ را از بافت جمله حدس بزند. نبودن نیمفاصله، اعداد رقمی، مخففها و اسمهای خاص خارجی هم خطا را بیشتر میکند. با اصلاح نیمفاصله، نوشتن اعداد با حروف و گذاشتن اعراب روی کلمات دوپهلو، بیشتر این خطاها برطرف میشود.
آیا کلونکردن صدای دیگران قانونی است؟
+
کلون صدای هر فرد فقط با رضایت صریح و ترجیحاً کتبی خود او قابل قبول است. ElevenLabs در کلون حرفهای فقط اجازهی کلون صدای خود کاربر را میدهد و تقلید صدای دیگران بدون رضایت را ممنوع کرده است. استفاده از صدای جعلی برای فریب یا کلاهبرداری میتواند پیامد قانونی جدی داشته باشد.
برای کلون صدا چقدر نمونهی صوتی لازم است؟
+
طبق اعلام ElevenLabs، مدلهای v4 میتوانند با حدود ۱۰ ثانیه صدا یک کلون فوری بسازند، ولی شباهت آن کامل نیست. برای کلون حرفهای با شباهت بالا، معمولاً دهها دقیقه صدای تمیز، بدون نویز و موسیقی و با لحن یکنواخت لازم است. کیفیت میکروفون و محیط ضبط بیشتر از طول نمونه اهمیت دارد.
آیا میتوانم صدای ساختهشده را در یوتیوب یا تبلیغات استفاده کنم؟
+
در اغلب پلنهای پولی ElevenLabs و OpenAI استفادهی تجاری از خروجی مجاز است، اما شرایط هر سرویس متفاوت است. مثلاً Eleven Music در پلنهای غیرسازمانی برای فیلم سینمایی و تلویزیون استثنا دارد. OpenAI هم الزام میکند به شنونده اطلاع دهید صدا با هوش مصنوعی ساخته شده است. پیش از انتشار تجاری شرایط استفاده را بخوانید.
فرق ElevenLabs با OpenAI TTS چیست؟
+
ElevenLabs تخصصی روی صدا کار میکند: کتابخانهی بزرگ صدا، کلون صدا، تگهای احساسی، افکت صوتی و موسیقی دارد و کیفیت فارسیاش معمولاً طبیعیتر است. OpenAI TTS سادهتر و ارزانتر است، ۱۳ صدای آماده دارد و لحن را با یک دستور متنی تنظیم میکند. برای پروژههای حرفهای ElevenLabs و برای کارهای حجیم OpenAI مناسبتر است.