لورم ایپسوم متن ساختگی با تولید سادگی نامفهوم از

لورم ایپسوم متن ساختگی با تولید سادگی نامفهوم از

متن تیتر خود را وارد کنید

پایگاه خبری CIT رسانه‌ای تخصصی در حوزه فناوری اطلاعات و ارتباطات ایران است که اخبار و تحولات اکوسیستم ICT را پوشش می‌دهد. تمرکز آن بر اطلاع‌رسانی تحلیلی درباره فناوری، اقتصاد دیجیتال، استارتاپ‌ها و امنیت سایبری است.این رسانه با پوشش فعالیت فعالان صنعت ICT، نقش پل ارتباطی میان صنعت، سیاست‌گذاران و مخاطبان را ایفا می‌کند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

پست های مرتبط

به گزارش آی سی تی نیوز؛  گوگل در تاریخ ۲۲ و ۲۳ سپتامبر ۲۰۲۶ (۳۱ شهریور و ۱ مهر ۱۴۰۵) از دو مدل صوتی جدید خود با نام‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرد. گوگل این مدل‌ها را «بیانگرترین مدل‌های صوتی این شرکت تا به امروز» توصیف کرده است. کاربران می‌توانند در بیش از ۱۰۰ زبان صدای سفارشی بسازند یا از میان بیش از ۲,۰۰۰ صدای آماده انتخاب کنند. قابلیت هدایت گفت‌وگوهای رفت‌وبرگشتی و کنترل نحوه بیان جملات نیز از دیگر ویژگی‌های این مدل‌ها محسوب می‌شود.

 

قابلیت‌های کلیدی مدل‌های صوتی جدید

Gemini 3.8 Flash TTS از بیش از ۱۰۰ زبان و گویش پشتیبانی می‌کند (بر اساس مستندات API، ۱۳۰ زبان) و Flash-Lite TTS نیز ۱۰۱ زبان را پوشش می‌دهد. این مدل‌ها امکان ساخت صدای سفارشی از صفر با پرامپت متنی را فراهم می‌کنند و کاربران می‌توانند از میان بیش از ۲,۰۰۰ صدای آماده، گزینه مورد نظر خود را انتخاب کنند.

یکی از قابلیت‌های برجسته این مدل‌ها، کنترل اجرای خط‌به‌خط دیالوگ‌ها با دستورات صحنه است. کاربران می‌توانند لحن، سرعت، لهجه و صداهای غیرکلامی مانند خنده و آه را در دیالوگ‌ها تعیین کنند. این ویژگی به توسعه‌دهندگان امکان می‌دهد تجربه‌های صوتی طبیعی‌تری خلق کنند.

 

شبیه‌سازی صدا با ۳۰ ثانیه نمونه

مدل Flash TTS می‌تواند صدای کاربر را تنها با یک نمونه صوتی ۳۰ ثانیه‌ای بازسازی کند. این قابلیت نیازمند تأیید رضایت کلامی از صاحب صدا و تطابق آن با گوینده مرجع است تا از سوءاستفاده جلوگیری شود.

 

واترمارک و اعتبارنامه C2PA

تمام کلیپ‌های صوتی تولیدشده توسط مدل‌های Gemini Audio با فناوری SynthID واترمارک می‌شوند و صداهای شبیه‌سازی‌شده اعتبارنامه C2PA نیز دریافت می‌کنند. این اقدام گوگل در راستای شفافیت و جلوگیری از سوءاستفاده از محتوای صوتی مصنوعی انجام شده است.

 

عملکرد در بنچمارک‌ها

مدل Flash TTS در بنچمارک Hume AI Voice Design با امتیاز ۷۱.۴ رتبه نخست را کسب کرده است. در شاخص کیفیت کلی نیز Flash TTS و Flash-Lite TTS به‌ترتیب رتبه‌های اول و دوم را به دست آورده‌اند. این نتایج نشان می‌دهد که گوگل توانسته در حوزه مدل‌های صوتی، جایگاه رقابتی قابل‌توجهی به دست آورد.

 

کیفیت در محتوای طولانی

هر دو مدل می‌توانند کیفیت صدا، سرعت طبیعی و تیمبر شخصیت را در ساعت‌ها صدای پیوسته با حداقل جابه‌جایی گوینده حفظ کنند. این ویژگی به‌ویژه برای کتاب‌های صوتی، پادکست‌ها و محتوای طولانی بسیار کاربردی است.

 

قیمت‌گذاری

هزینه هر یک میلیون توکن خروجی صوتی برای Flash TTS حدود ۹ دلار و برای Flash-Lite TTS حدود ۶ دلار است. این قیمت تا پایان سال ۲۰۲۶ به‌صورت نیم‌بها (۵۰ درصد تخفیف) اعمال می‌شود و از ژانویه ۲۰۲۷ به قیمت کامل بازمی‌گردد.

 

دسترسی به مدل‌ها

Gemini 3.8 Flash TTS در Gemini Notebook و Gemini 3.8 Flash-Lite TTS در Google Vids در دسترس قرار گرفته‌اند. هر دو مدل در Gemini API و Google AI Studio نیز برای توسعه‌دهندگان قابل استفاده هستند. دسترسی سازمانی از طریق Gemini Enterprise نیز به‌زودی فراهم می‌شود.

 

کاربردهای هدف

Flash TTS برای بازی‌ها، کتاب‌های صوتی، پادکست‌ها و رسانه‌های تعاملی طراحی شده، در حالی که Flash-Lite TTS برای دوبله انبوه، تولید محتوای صوتی حجم بالا و ایجنت‌های صوتی بهینه‌سازی شده است. این تفکیک به توسعه‌دهندگان امکان می‌دهد بر اساس نیاز پروژه خود، مدل مناسب را انتخاب کنند.

 

تحلیل ICTNews

معرفی Gemini 3.8 Flash TTS و Flash-Lite TTS نشان‌دهنده عزم جدی گوگل برای تسخیر بازار مدل‌های صوتی است. گوگل با ارائه بیش از ۲,۰۰۰ صدا، پشتیبانی از ۱۰۰ زبان و قابلیت شبیه‌سازی صدا با ۳۰ ثانیه نمونه، مستقیماً به رقابت با ElevenLabs رفته است که تا پیش از این، پیشتاز بازار مدل‌های صوتی محسوب می‌شد.

نکته قابل توجه، تفکیک استراتژیک گوگل بین دو مدل است. Flash TTS برای کاربردهای با کیفیت بالا و Flash-Lite TTS برای کاربردهای انبوه با هزینه کمتر طراحی شده‌اند. این رویکرد به گوگل امکان می‌دهد هم کاربران حرفه‌ای و هم کسب‌وکارهای کوچک را هدف قرار دهد.

واترمارک SynthID و اعتبارنامه C2PA نیز نشان‌دهنده توجه گوگل به نگرانی‌های اخلاقی و قانونی درباره محتوای صوتی مصنوعی است. در شرایطی که سوءاستفاده از صداهای شبیه‌سازی‌شده رو به افزایش است، این اقدام می‌تواند به ایجاد اعتماد در بازار کمک کند.

آخرین اخبار کسب و کار

برچسب ها