معرفی Gemini 3.8 Flash TTS؛ کلون صدا با ۳۰ ثانیه نمونه و پشتیبانی از فارسی
گوگل مدل Gemini 3.8 Flash TTS را با ۲۰۰۰ صدا، کلون صدا از ۳۰ ثانیه نمونه و پشتیبانی از فارسی معرفی کرد؛ قیمت، نحوهٔ دسترسی و قابلیت Live Avatar.

گوگل روز ۱ مهر ۱۴۰۵ (۲۳ سپتامبر ۲۰۲۶) دو مدل تازهٔ تبدیل متن به گفتار با نامهای Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS را معرفی کرد. مهمترین قابلیت این نسل، ساخت صدای دلخواه فقط با توصیف متنی و شبیهسازی (کلون) صدا از روی یک نمونهٔ ۳۰ ثانیهای است؛ و خبر خوب برای ما این است که زبان فارسی هم در فهرست زبانهای پشتیبانیشده قرار دارد.
یک روز بعد، گوگل مدل Gemini 3.8 Live with Live Avatar را هم عرضه کرد؛ دستیاری صوتی که حالا یک چهرهٔ متحرک با لبخوانی هماهنگ دارد و در ۹۷ زبان گفتوگو میکند. در این مقاله هر دو خبر را با جزئیات، قیمت و کاربردشان برای کاربر ایرانی بررسی میکنیم.
- مدل Gemini 3.8 Flash TTS بیش از ۲۰۰۰ صدای آماده دارد و طبق مستندات گوگل از بیش از ۱۳۰ زبان، از جمله فارسی، پشتیبانی میکند.
- امکان طراحی صدا با توصیف متنی و کلون صدا با نمونهٔ ۳۰ ثانیهای (با تأیید رضایت صاحب صدا) اضافه شده است.
- استفاده در Google AI Studio رایگان است؛ نسخهٔ پولی API برای خروجی صوتی ۹ دلار به ازای هر یک میلیون توکن است و از ۱۱ دی ۱۴۰۵ دو برابر میشود.
- قابلیت Live Avatar یک آواتار ویدیویی گویا با لبخوانی هماهنگ در ۹۷ زبان میسازد، اما فعلاً مخصوص کاربران سازمانی است.
- همهٔ خروجیها واترمارک نامرئی SynthID دارند تا تشخیص محتوای ساخت هوش مصنوعی ممکن باشد.
مدل Gemini 3.8 Flash TTS چیست و چه چیزی را عوض میکند؟
مدلهای TTS (مخفف Text-to-Speech یعنی تبدیل متن به گفتار) متن را میگیرند و آن را با صدای طبیعی میخوانند. نسل قبلی Gemini فقط حدود ۳۰ صدای ثابت داشت؛ گوگل میگوید حالا این کتابخانه به بیش از ۲۰۰۰ صدای آمادهٔ تولید رسیده و عملاً با قابلیت طراحی صدا «بینهایت» شده است.
گوگل این نسل را در دو نسخه عرضه کرده است:
- مدل Gemini 3.8 Flash TTS: نسخهٔ پرچمدار برای کارهای خلاقانه مثل کتاب صوتی، پادکست، بازی و روایت داستان؛ با کنترل دقیق لحن، احساس و لهجه.
- مدل Gemini 3.8 Flash-Lite TTS: نسخهٔ سبکتر و ارزانتر برای حجم بالا، مثل دوبله، دستیارهای صوتی و مراکز تماس.
طراحی صدا با توصیف متنی
به جای انتخاب از یک فهرست محدود، میتوانید صدای موردنظرتان را با زبان عادی توصیف کنید؛ مثلاً نقش، سن، لهجه و ویژگیهای صدا را بنویسید تا مدل صدایی متناسب با آن بسازد. گوگل همچنین اعلام کرده قابلیت «ریمیکس صدا» برای تغییر زیر و بمی، سرعت و لهجهٔ یک صدای موجود بهزودی اضافه میشود.
کلون صدا با فقط ۳۰ ثانیه نمونه
با یک فایل صوتی ۳۰ ثانیهای میتوان نسخهٔ دیجیتال یک صدا را ساخت و متنهای طولانی را با همان صدا تولید کرد. گوگل برای جلوگیری از سوءاستفاده، تأیید رضایت صاحب صدا را الزامی کرده و به خروجیها گواهی C2PA (استاندارد ثبت منشأ محتوا) اضافه میکند. این قابلیت در AI Studio فعلاً در بریتانیا، منطقهٔ اقتصادی اروپا، سوئیس، هند و ایالتهای تگزاس و ایلینوی در دسترس نیست.
کارگردانی اجرا، خط به خط
شاید جذابترین بخش برای تولیدکنندگان محتوا، کنترل اجرای صدا باشد. میتوانید برای هر خط دستور جداگانه بنویسید (آرامتر، هیجانزده، با زمزمه) و صداهای غیرکلامی مثل خنده، آه و مکث را با برچسبهایی مانند <laughs> یا <sigh> دقیقاً در جای موردنظر متن قرار دهید. گفتوگوی دو نفره در یک درخواست و تولید محتوای طولانی در حد چند ساعت هم پشتیبانی میشود.
عملکرد در بنچمارکها
به گفتهٔ گوگل، مدل Gemini 3.8 Flash TTS در بنچمارک (آزمون استاندارد سنجش عملکرد) طراحی صدای شرکت Hume AI با امتیاز ۷۱٫۴ رتبهٔ اول کلی و با امتیاز ۶۰٫۸ رتبهٔ اول در مدلسازی لهجه را گرفته است. در شاخص کیفیت کلی همین آزمون هم نسخهٔ Flash اول و نسخهٔ Flash-Lite دوم شدهاند. البته این نتایج را خود گوگل منتشر کرده و مقایسهٔ مستقل و گسترده با رقبایی مثل ElevenLabs هنوز در دسترس نیست.
قیمت و دسترسی Gemini 3.8 Flash TTS
هر دو مدل از همان روز معرفی در Gemini API و Google AI Studio فعال شدهاند. کاربران عادی هم میتوانند نسخهٔ Flash را در Gemini Notebook (نام جدید NotebookLM) و نسخهٔ Flash-Lite را در Google Vids تجربه کنند. طبق صفحهٔ رسمی قیمتگذاری، استفاده در سطح رایگان هزینهای ندارد و قیمت نسخهٔ پولی به این شکل است:
| مدل | ورودی متن (هر ۱ میلیون توکن) | خروجی صوت (هر ۱ میلیون توکن) | از ۱ ژانویهٔ ۲۰۲۷ |
|---|---|---|---|
| مدل Gemini 3.8 Flash TTS | ۰٫۵ دلار | ۹ دلار | ۱ دلار / ۱۸ دلار |
| مدل Gemini 3.8 Flash-Lite TTS | ۰٫۵ دلار | ۶ دلار | ۱ دلار / ۱۲ دلار |
در حالت Batch (پردازش دستهای و غیرفوری) قیمتها نصف میشود. برخی تحلیلگران هزینهٔ هر ساعت گفتار با نسخهٔ Flash را با نرخ فعلی حدود ۰٫۸ دلار برآورد کردهاند. نکتهٔ مهم این است که گوگل اعلام کرده همهٔ این نرخها از ۱ ژانویهٔ ۲۰۲۷ (۱۱ دی ۱۴۰۵) دو برابر میشوند.
قابلیت Live Avatar؛ دستیار صوتی Gemini حالا چهره دارد
خبر دوم گوگل در همین هفته، عرضهٔ عمومی مدل Gemini 3.8 Live with Live Avatar در ۲ مهر ۱۴۰۵ بود. این مدل روی گفتوگوی صوتی همزمان Gemini Live ساخته شده و حالا تقریباً بهصورت آنی یک آواتار ویدیویی با حرکت لب هماهنگ، حالات طبیعی چهره و نوبتگیری روان در گفتوگو تولید میکند. به گفتهٔ گوگل، آواتار میتواند وسط گفتوگو بین ۹۷ زبان جابهجا شود و لبخوانی را با زبان جدید تطبیق دهد.

این محصول فعلاً سازمانی است و از طریق Gemini Enterprise و Gemini Live API ارائه میشود. مشتریان میتوانند از آواتارهای آماده استفاده کنند، اما ساخت آواتار سفارشی فقط پس از بررسی و تأیید گوگل ممکن است. نمونههایی مثل دستیار خرید خودروی Autotrader و سامانهٔ تماس Equal AI که روزانه بیش از یک میلیون تماس را به ۹ زبان رایج در هند پاسخ میدهد، نشان میدهد هدف اصلی گوگل، پشتیبانی مشتری و فروش است. همهٔ خروجیهای صوتی و تصویری این مدل هم واترمارک SynthID دارند.
این خبر برای کاربر ایرانی چه معنایی دارد؟
- پشتیبانی رسمی از فارسی: در جدول زبانهای مستندات Gemini API، زبان فارسی (Iranian Persian) برای هر دو مدل Flash و Flash-Lite تیک خورده است. پس میتوان برای روایت ویدیو، کتاب صوتی یا پادکست فارسی از آن استفاده کرد؛ هرچند کیفیت لهجه و تلفظ فارسی را باید خودتان با متنهای واقعی بسنجید.
- تولید محتوا با هزینهٔ کم: برای یوتیوبرها، مدرسهای آنلاین و کسبوکارهای کوچک، صداگذاری با کیفیت و چندصدایی دیگر به استودیو نیاز ندارد.
- محدودیت دسترسی: سرویسهای Google AI Studio و Gemini API بهطور رسمی در ایران در دسترس نیستند و پرداخت نسخهٔ پولی هم با کارت ایرانی ممکن نیست؛ بنابراین استفادهٔ جدی به حساب و روش پرداخت معتبر نیاز دارد.
- هشدار امنیتی: وقتی کلون صدا با ۳۰ ثانیه ممکن است، به تماسها و پیامهای صوتی مشکوک از طرف آشنایان که درخواست پول دارند اعتماد نکنید و از راه دیگری صحت آن را بررسی کنید.
چطور Gemini 3.8 Flash TTS را امتحان کنیم؟
- وارد Google AI Studio شوید و بخش تولید گفتار (Speech) را باز کنید.
- مدل gemini-3.8-flash-tts یا نسخهٔ Lite را انتخاب کنید.
- متن فارسی را وارد کنید و در بخش دستورالعمل، لحن و سبک اجرا را بنویسید؛ مثلاً «گویندهای گرم و آرام برای روایت مستند».
- برای مکث یا خنده از برچسبهایی مثل <short pause> و <laughs> در جای مناسب متن استفاده کنید.
- خروجی را بشنوید و دستورها را آنقدر اصلاح کنید تا به اجرای دلخواه برسید؛ خروجی این نسل بهطور پیشفرض فایل WAV است.
اگر به قابلیتهای چندوجهی گوگل علاقه دارید، مقالهٔ قبلی ما دربارهٔ دموهای Gemini Omni و Gemini 3.5 را هم ببینید. برای مقایسهٔ جدیدترین مدلهای رقیب هم میتوانید مقایسهٔ GPT-6 Sol و Luna با Claude Opus 5.5 را بخوانید.
جمعبندی
گوگل با Gemini 3.8 Flash TTS تبدیل متن به گفتار را از «خواندن متن» به «کارگردانی اجرا» رسانده است: صدای دلخواه با توصیف متنی، کلون صدا با ۳۰ ثانیه نمونه، کنترل احساس خط به خط و پشتیبانی از فارسی، آن هم با سطح رایگان در AI Studio. قابلیت Live Avatar هم نشان میدهد مسیر بعدی دستیارهای صوتی، گفتوگوی تصویری است؛ هرچند فعلاً فقط در اختیار سازمانهاست. اگر برای استفادهٔ بدون دردسر از این ابزارها به حساب پولی نیاز دارید، میتوانید از اشتراکهای قانونی ChatGPT، Claude و Gemini کمک بگیرید.
سؤالات متداول
آیا Gemini 3.8 Flash TTS از زبان فارسی پشتیبانی میکند؟
بله. در جدول زبانهای مستندات رسمی Gemini API، فارسی برای هر دو مدل Gemini 3.8 Flash TTS و Flash-Lite TTS بهعنوان زبان پشتیبانیشده آمده است.
آیا استفاده از Gemini 3.8 Flash TTS رایگان است؟
در سطح رایگان Google AI Studio ورودی و خروجی هزینهای ندارد. در نسخهٔ پولی API، خروجی صوتی مدل Flash تا پایان ۲۰۲۶ برای هر یک میلیون توکن ۹ دلار و مدل Flash-Lite ۶ دلار است.
برای کلون صدا در Gemini چقدر نمونهٔ صوتی لازم است؟
گوگل میگوید یک نمونهٔ ۳۰ ثانیهای کافی است، اما تأیید رضایت صاحب صدا الزامی است و این قابلیت در برخی مناطق مثل اروپا، بریتانیا و هند فعال نیست.
قابلیت Live Avatar در Gemini چیست و چه کسانی به آن دسترسی دارند؟
قابلیت Live Avatar یک چهرهٔ ویدیویی گویا با لبخوانی هماهنگ برای دستیار صوتی Gemini 3.8 Live میسازد و ۹۷ زبان را پشتیبانی میکند. فعلاً فقط از طریق Gemini Enterprise و Live API در دسترس سازمانهاست.
چطور بفهمیم یک صدا با هوش مصنوعی گوگل ساخته شده است؟
همهٔ خروجیهای این مدلها واترمارک نامرئی SynthID دارند که با ابزارهای تشخیص گوگل قابل شناسایی است؛ با این حال در برابر تماسهای مشکوک بهتر است همیشه از راه دیگری صحت آن را بررسی کنید.
منابع: وبلاگ گوگل: Gemini 3.8 Flash TTS • مستندات تولید گفتار Gemini API • صفحهٔ قیمتگذاری Gemini API • وبلاگ گوگل: Gemini 3.8 Live with Live Avatar • وبلاگ Google Cloud • Android Authority • eesel AI (برآورد هزینه)


