پرش به محتوا

معرفی Gemini 3.8 Flash TTS؛ کلون صدا با ۳۰ ثانیه نمونه و پشتیبانی از فارسی

گوگل مدل Gemini 3.8 Flash TTS را با ۲۰۰۰ صدا، کلون صدا از ۳۰ ثانیه نمونه و پشتیبانی از فارسی معرفی کرد؛ قیمت، نحوهٔ دسترسی و قابلیت Live Avatar.

اخبار ۳ مهر ۱۴۰۵| ۸ دقیقه مطالعه
معرفی Gemini 3.8 Flash TTS؛ کلون صدا با ۳۰ ثانیه نمونه و پشتیبانی از فارسی

گوگل روز ۱ مهر ۱۴۰۵ (۲۳ سپتامبر ۲۰۲۶) دو مدل تازهٔ تبدیل متن به گفتار با نام‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS را معرفی کرد. مهم‌ترین قابلیت این نسل، ساخت صدای دلخواه فقط با توصیف متنی و شبیه‌سازی (کلون) صدا از روی یک نمونهٔ ۳۰ ثانیه‌ای است؛ و خبر خوب برای ما این است که زبان فارسی هم در فهرست زبان‌های پشتیبانی‌شده قرار دارد.

یک روز بعد، گوگل مدل Gemini 3.8 Live with Live Avatar را هم عرضه کرد؛ دستیاری صوتی که حالا یک چهرهٔ متحرک با لب‌خوانی هماهنگ دارد و در ۹۷ زبان گفت‌وگو می‌کند. در این مقاله هر دو خبر را با جزئیات، قیمت و کاربردشان برای کاربر ایرانی بررسی می‌کنیم.

خلاصه در یک نگاه
  • مدل Gemini 3.8 Flash TTS بیش از ۲۰۰۰ صدای آماده دارد و طبق مستندات گوگل از بیش از ۱۳۰ زبان، از جمله فارسی، پشتیبانی می‌کند.
  • امکان طراحی صدا با توصیف متنی و کلون صدا با نمونهٔ ۳۰ ثانیه‌ای (با تأیید رضایت صاحب صدا) اضافه شده است.
  • استفاده در Google AI Studio رایگان است؛ نسخهٔ پولی API برای خروجی صوتی ۹ دلار به ازای هر یک میلیون توکن است و از ۱۱ دی ۱۴۰۵ دو برابر می‌شود.
  • قابلیت Live Avatar یک آواتار ویدیویی گویا با لب‌خوانی هماهنگ در ۹۷ زبان می‌سازد، اما فعلاً مخصوص کاربران سازمانی است.
  • همهٔ خروجی‌ها واترمارک نامرئی SynthID دارند تا تشخیص محتوای ساخت هوش مصنوعی ممکن باشد.

مدل Gemini 3.8 Flash TTS چیست و چه چیزی را عوض می‌کند؟

مدل‌های TTS (مخفف Text-to-Speech یعنی تبدیل متن به گفتار) متن را می‌گیرند و آن را با صدای طبیعی می‌خوانند. نسل قبلی Gemini فقط حدود ۳۰ صدای ثابت داشت؛ گوگل می‌گوید حالا این کتابخانه به بیش از ۲۰۰۰ صدای آمادهٔ تولید رسیده و عملاً با قابلیت طراحی صدا «بی‌نهایت» شده است.

گوگل این نسل را در دو نسخه عرضه کرده است:

  • مدل Gemini 3.8 Flash TTS: نسخهٔ پرچم‌دار برای کارهای خلاقانه مثل کتاب صوتی، پادکست، بازی و روایت داستان؛ با کنترل دقیق لحن، احساس و لهجه.
  • مدل Gemini 3.8 Flash-Lite TTS: نسخهٔ سبک‌تر و ارزان‌تر برای حجم بالا، مثل دوبله، دستیارهای صوتی و مراکز تماس.

طراحی صدا با توصیف متنی

به جای انتخاب از یک فهرست محدود، می‌توانید صدای موردنظرتان را با زبان عادی توصیف کنید؛ مثلاً نقش، سن، لهجه و ویژگی‌های صدا را بنویسید تا مدل صدایی متناسب با آن بسازد. گوگل همچنین اعلام کرده قابلیت «ریمیکس صدا» برای تغییر زیر و بمی، سرعت و لهجهٔ یک صدای موجود به‌زودی اضافه می‌شود.

کلون صدا با فقط ۳۰ ثانیه نمونه

با یک فایل صوتی ۳۰ ثانیه‌ای می‌توان نسخهٔ دیجیتال یک صدا را ساخت و متن‌های طولانی را با همان صدا تولید کرد. گوگل برای جلوگیری از سوءاستفاده، تأیید رضایت صاحب صدا را الزامی کرده و به خروجی‌ها گواهی C2PA (استاندارد ثبت منشأ محتوا) اضافه می‌کند. این قابلیت در AI Studio فعلاً در بریتانیا، منطقهٔ اقتصادی اروپا، سوئیس، هند و ایالت‌های تگزاس و ایلینوی در دسترس نیست.

کارگردانی اجرا، خط به خط

شاید جذاب‌ترین بخش برای تولیدکنندگان محتوا، کنترل اجرای صدا باشد. می‌توانید برای هر خط دستور جداگانه بنویسید (آرام‌تر، هیجان‌زده، با زمزمه) و صداهای غیرکلامی مثل خنده، آه و مکث را با برچسب‌هایی مانند <laughs> یا <sigh> دقیقاً در جای موردنظر متن قرار دهید. گفت‌وگوی دو نفره در یک درخواست و تولید محتوای طولانی در حد چند ساعت هم پشتیبانی می‌شود.

عملکرد در بنچمارک‌ها

به گفتهٔ گوگل، مدل Gemini 3.8 Flash TTS در بنچمارک (آزمون استاندارد سنجش عملکرد) طراحی صدای شرکت Hume AI با امتیاز ۷۱٫۴ رتبهٔ اول کلی و با امتیاز ۶۰٫۸ رتبهٔ اول در مدل‌سازی لهجه را گرفته است. در شاخص کیفیت کلی همین آزمون هم نسخهٔ Flash اول و نسخهٔ Flash-Lite دوم شده‌اند. البته این نتایج را خود گوگل منتشر کرده و مقایسهٔ مستقل و گسترده با رقبایی مثل ElevenLabs هنوز در دسترس نیست.

قیمت و دسترسی Gemini 3.8 Flash TTS

هر دو مدل از همان روز معرفی در Gemini API و Google AI Studio فعال شده‌اند. کاربران عادی هم می‌توانند نسخهٔ Flash را در Gemini Notebook (نام جدید NotebookLM) و نسخهٔ Flash-Lite را در Google Vids تجربه کنند. طبق صفحهٔ رسمی قیمت‌گذاری، استفاده در سطح رایگان هزینه‌ای ندارد و قیمت نسخهٔ پولی به این شکل است:

مدلورودی متن (هر ۱ میلیون توکن)خروجی صوت (هر ۱ میلیون توکن)از ۱ ژانویهٔ ۲۰۲۷
مدل Gemini 3.8 Flash TTS۰٫۵ دلار۹ دلار۱ دلار / ۱۸ دلار
مدل Gemini 3.8 Flash-Lite TTS۰٫۵ دلار۶ دلار۱ دلار / ۱۲ دلار

در حالت Batch (پردازش دسته‌ای و غیرفوری) قیمت‌ها نصف می‌شود. برخی تحلیلگران هزینهٔ هر ساعت گفتار با نسخهٔ Flash را با نرخ فعلی حدود ۰٫۸ دلار برآورد کرده‌اند. نکتهٔ مهم این است که گوگل اعلام کرده همهٔ این نرخ‌ها از ۱ ژانویهٔ ۲۰۲۷ (۱۱ دی ۱۴۰۵) دو برابر می‌شوند.

قابلیت Live Avatar؛ دستیار صوتی Gemini حالا چهره دارد

خبر دوم گوگل در همین هفته، عرضهٔ عمومی مدل Gemini 3.8 Live with Live Avatar در ۲ مهر ۱۴۰۵ بود. این مدل روی گفت‌وگوی صوتی هم‌زمان Gemini Live ساخته شده و حالا تقریباً به‌صورت آنی یک آواتار ویدیویی با حرکت لب هماهنگ، حالات طبیعی چهره و نوبت‌گیری روان در گفت‌وگو تولید می‌کند. به گفتهٔ گوگل، آواتار می‌تواند وسط گفت‌وگو بین ۹۷ زبان جابه‌جا شود و لب‌خوانی را با زبان جدید تطبیق دهد.

تصویر معرفی قابلیت Live Avatar در مدل Gemini 3.8 Live گوگل
قابلیت Live Avatar در Gemini 3.8 Live، آواتار گویا با لب‌خوانی هماهنگ در ۹۷ زبان (منبع: Google Cloud)

این محصول فعلاً سازمانی است و از طریق Gemini Enterprise و Gemini Live API ارائه می‌شود. مشتریان می‌توانند از آواتارهای آماده استفاده کنند، اما ساخت آواتار سفارشی فقط پس از بررسی و تأیید گوگل ممکن است. نمونه‌هایی مثل دستیار خرید خودروی Autotrader و سامانهٔ تماس Equal AI که روزانه بیش از یک میلیون تماس را به ۹ زبان رایج در هند پاسخ می‌دهد، نشان می‌دهد هدف اصلی گوگل، پشتیبانی مشتری و فروش است. همهٔ خروجی‌های صوتی و تصویری این مدل هم واترمارک SynthID دارند.

این خبر برای کاربر ایرانی چه معنایی دارد؟

  • پشتیبانی رسمی از فارسی: در جدول زبان‌های مستندات Gemini API، زبان فارسی (Iranian Persian) برای هر دو مدل Flash و Flash-Lite تیک خورده است. پس می‌توان برای روایت ویدیو، کتاب صوتی یا پادکست فارسی از آن استفاده کرد؛ هرچند کیفیت لهجه و تلفظ فارسی را باید خودتان با متن‌های واقعی بسنجید.
  • تولید محتوا با هزینهٔ کم: برای یوتیوبرها، مدرس‌های آنلاین و کسب‌وکارهای کوچک، صداگذاری با کیفیت و چندصدایی دیگر به استودیو نیاز ندارد.
  • محدودیت دسترسی: سرویس‌های Google AI Studio و Gemini API به‌طور رسمی در ایران در دسترس نیستند و پرداخت نسخهٔ پولی هم با کارت ایرانی ممکن نیست؛ بنابراین استفادهٔ جدی به حساب و روش پرداخت معتبر نیاز دارد.
  • هشدار امنیتی: وقتی کلون صدا با ۳۰ ثانیه ممکن است، به تماس‌ها و پیام‌های صوتی مشکوک از طرف آشنایان که درخواست پول دارند اعتماد نکنید و از راه دیگری صحت آن را بررسی کنید.

چطور Gemini 3.8 Flash TTS را امتحان کنیم؟

  1. وارد Google AI Studio شوید و بخش تولید گفتار (Speech) را باز کنید.
  2. مدل gemini-3.8-flash-tts یا نسخهٔ Lite را انتخاب کنید.
  3. متن فارسی را وارد کنید و در بخش دستورالعمل، لحن و سبک اجرا را بنویسید؛ مثلاً «گوینده‌ای گرم و آرام برای روایت مستند».
  4. برای مکث یا خنده از برچسب‌هایی مثل <short pause> و <laughs> در جای مناسب متن استفاده کنید.
  5. خروجی را بشنوید و دستورها را آن‌قدر اصلاح کنید تا به اجرای دلخواه برسید؛ خروجی این نسل به‌طور پیش‌فرض فایل WAV است.

اگر به قابلیت‌های چندوجهی گوگل علاقه دارید، مقالهٔ قبلی ما دربارهٔ دموهای Gemini Omni و Gemini 3.5 را هم ببینید. برای مقایسهٔ جدیدترین مدل‌های رقیب هم می‌توانید مقایسهٔ GPT-6 Sol و Luna با Claude Opus 5.5 را بخوانید.

جمع‌بندی

گوگل با Gemini 3.8 Flash TTS تبدیل متن به گفتار را از «خواندن متن» به «کارگردانی اجرا» رسانده است: صدای دلخواه با توصیف متنی، کلون صدا با ۳۰ ثانیه نمونه، کنترل احساس خط به خط و پشتیبانی از فارسی، آن هم با سطح رایگان در AI Studio. قابلیت Live Avatar هم نشان می‌دهد مسیر بعدی دستیارهای صوتی، گفت‌وگوی تصویری است؛ هرچند فعلاً فقط در اختیار سازمان‌هاست. اگر برای استفادهٔ بدون دردسر از این ابزارها به حساب پولی نیاز دارید، می‌توانید از اشتراک‌های قانونی ChatGPT، Claude و Gemini کمک بگیرید.

سؤالات متداول

آیا Gemini 3.8 Flash TTS از زبان فارسی پشتیبانی می‌کند؟

بله. در جدول زبان‌های مستندات رسمی Gemini API، فارسی برای هر دو مدل Gemini 3.8 Flash TTS و Flash-Lite TTS به‌عنوان زبان پشتیبانی‌شده آمده است.

آیا استفاده از Gemini 3.8 Flash TTS رایگان است؟

در سطح رایگان Google AI Studio ورودی و خروجی هزینه‌ای ندارد. در نسخهٔ پولی API، خروجی صوتی مدل Flash تا پایان ۲۰۲۶ برای هر یک میلیون توکن ۹ دلار و مدل Flash-Lite ۶ دلار است.

برای کلون صدا در Gemini چقدر نمونهٔ صوتی لازم است؟

گوگل می‌گوید یک نمونهٔ ۳۰ ثانیه‌ای کافی است، اما تأیید رضایت صاحب صدا الزامی است و این قابلیت در برخی مناطق مثل اروپا، بریتانیا و هند فعال نیست.

قابلیت Live Avatar در Gemini چیست و چه کسانی به آن دسترسی دارند؟

قابلیت Live Avatar یک چهرهٔ ویدیویی گویا با لب‌خوانی هماهنگ برای دستیار صوتی Gemini 3.8 Live می‌سازد و ۹۷ زبان را پشتیبانی می‌کند. فعلاً فقط از طریق Gemini Enterprise و Live API در دسترس سازمان‌هاست.

چطور بفهمیم یک صدا با هوش مصنوعی گوگل ساخته شده است؟

همهٔ خروجی‌های این مدل‌ها واترمارک نامرئی SynthID دارند که با ابزارهای تشخیص گوگل قابل شناسایی است؛ با این حال در برابر تماس‌های مشکوک بهتر است همیشه از راه دیگری صحت آن را بررسی کنید.

منابع: وبلاگ گوگل: Gemini 3.8 Flash TTS • مستندات تولید گفتار Gemini API • صفحهٔ قیمت‌گذاری Gemini API • وبلاگ گوگل: Gemini 3.8 Live with Live Avatar • وبلاگ Google Cloud • Android Authority • eesel AI (برآورد هزینه)

اشتراک‌گذاری: تلگرام واتس‌اپ

همین الان امتحانش کن

اشتراک قانونی ChatGPT، Claude و Gemini — خرید آنلاین و تحویل سریع

مشاهده اشتراک‌ها

مطالب مرتبط

سؤال داری؟ گفتگو با پشتیبانی