به گزارش آی سی تی نیوز؛ گوگل در تاریخ ۲۲ و ۲۳ سپتامبر ۲۰۲۶ (۳۱ شهریور و ۱ مهر ۱۴۰۵) از دو مدل صوتی جدید خود با نامهای Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرد. گوگل این مدلها را «بیانگرترین مدلهای صوتی این شرکت تا به امروز» توصیف کرده است. کاربران میتوانند در بیش از ۱۰۰ زبان صدای سفارشی بسازند یا از میان بیش از ۲,۰۰۰ صدای آماده انتخاب کنند. قابلیت هدایت گفتوگوهای رفتوبرگشتی و کنترل نحوه بیان جملات نیز از دیگر ویژگیهای این مدلها محسوب میشود.
قابلیتهای کلیدی مدلهای صوتی جدید
Gemini 3.8 Flash TTS از بیش از ۱۰۰ زبان و گویش پشتیبانی میکند (بر اساس مستندات API، ۱۳۰ زبان) و Flash-Lite TTS نیز ۱۰۱ زبان را پوشش میدهد. این مدلها امکان ساخت صدای سفارشی از صفر با پرامپت متنی را فراهم میکنند و کاربران میتوانند از میان بیش از ۲,۰۰۰ صدای آماده، گزینه مورد نظر خود را انتخاب کنند.
یکی از قابلیتهای برجسته این مدلها، کنترل اجرای خطبهخط دیالوگها با دستورات صحنه است. کاربران میتوانند لحن، سرعت، لهجه و صداهای غیرکلامی مانند خنده و آه را در دیالوگها تعیین کنند. این ویژگی به توسعهدهندگان امکان میدهد تجربههای صوتی طبیعیتری خلق کنند.
شبیهسازی صدا با ۳۰ ثانیه نمونه
مدل Flash TTS میتواند صدای کاربر را تنها با یک نمونه صوتی ۳۰ ثانیهای بازسازی کند. این قابلیت نیازمند تأیید رضایت کلامی از صاحب صدا و تطابق آن با گوینده مرجع است تا از سوءاستفاده جلوگیری شود.
واترمارک و اعتبارنامه C2PA
تمام کلیپهای صوتی تولیدشده توسط مدلهای Gemini Audio با فناوری SynthID واترمارک میشوند و صداهای شبیهسازیشده اعتبارنامه C2PA نیز دریافت میکنند. این اقدام گوگل در راستای شفافیت و جلوگیری از سوءاستفاده از محتوای صوتی مصنوعی انجام شده است.
عملکرد در بنچمارکها
مدل Flash TTS در بنچمارک Hume AI Voice Design با امتیاز ۷۱.۴ رتبه نخست را کسب کرده است. در شاخص کیفیت کلی نیز Flash TTS و Flash-Lite TTS بهترتیب رتبههای اول و دوم را به دست آوردهاند. این نتایج نشان میدهد که گوگل توانسته در حوزه مدلهای صوتی، جایگاه رقابتی قابلتوجهی به دست آورد.
کیفیت در محتوای طولانی
هر دو مدل میتوانند کیفیت صدا، سرعت طبیعی و تیمبر شخصیت را در ساعتها صدای پیوسته با حداقل جابهجایی گوینده حفظ کنند. این ویژگی بهویژه برای کتابهای صوتی، پادکستها و محتوای طولانی بسیار کاربردی است.
قیمتگذاری
هزینه هر یک میلیون توکن خروجی صوتی برای Flash TTS حدود ۹ دلار و برای Flash-Lite TTS حدود ۶ دلار است. این قیمت تا پایان سال ۲۰۲۶ بهصورت نیمبها (۵۰ درصد تخفیف) اعمال میشود و از ژانویه ۲۰۲۷ به قیمت کامل بازمیگردد.
دسترسی به مدلها
Gemini 3.8 Flash TTS در Gemini Notebook و Gemini 3.8 Flash-Lite TTS در Google Vids در دسترس قرار گرفتهاند. هر دو مدل در Gemini API و Google AI Studio نیز برای توسعهدهندگان قابل استفاده هستند. دسترسی سازمانی از طریق Gemini Enterprise نیز بهزودی فراهم میشود.
کاربردهای هدف
Flash TTS برای بازیها، کتابهای صوتی، پادکستها و رسانههای تعاملی طراحی شده، در حالی که Flash-Lite TTS برای دوبله انبوه، تولید محتوای صوتی حجم بالا و ایجنتهای صوتی بهینهسازی شده است. این تفکیک به توسعهدهندگان امکان میدهد بر اساس نیاز پروژه خود، مدل مناسب را انتخاب کنند.
تحلیل ICTNews
معرفی Gemini 3.8 Flash TTS و Flash-Lite TTS نشاندهنده عزم جدی گوگل برای تسخیر بازار مدلهای صوتی است. گوگل با ارائه بیش از ۲,۰۰۰ صدا، پشتیبانی از ۱۰۰ زبان و قابلیت شبیهسازی صدا با ۳۰ ثانیه نمونه، مستقیماً به رقابت با ElevenLabs رفته است که تا پیش از این، پیشتاز بازار مدلهای صوتی محسوب میشد.
نکته قابل توجه، تفکیک استراتژیک گوگل بین دو مدل است. Flash TTS برای کاربردهای با کیفیت بالا و Flash-Lite TTS برای کاربردهای انبوه با هزینه کمتر طراحی شدهاند. این رویکرد به گوگل امکان میدهد هم کاربران حرفهای و هم کسبوکارهای کوچک را هدف قرار دهد.
واترمارک SynthID و اعتبارنامه C2PA نیز نشاندهنده توجه گوگل به نگرانیهای اخلاقی و قانونی درباره محتوای صوتی مصنوعی است. در شرایطی که سوءاستفاده از صداهای شبیهسازیشده رو به افزایش است، این اقدام میتواند به ایجاد اعتماد در بازار کمک کند.