لورم ایپسوم متن ساختگی با تولید سادگی نامفهوم از

لورم ایپسوم متن ساختگی با تولید سادگی نامفهوم از

متن تیتر خود را وارد کنید

پایگاه خبری CIT رسانه‌ای تخصصی در حوزه فناوری اطلاعات و ارتباطات ایران است که اخبار و تحولات اکوسیستم ICT را پوشش می‌دهد. تمرکز آن بر اطلاع‌رسانی تحلیلی درباره فناوری، اقتصاد دیجیتال، استارتاپ‌ها و امنیت سایبری است.این رسانه با پوشش فعالیت فعالان صنعت ICT، نقش پل ارتباطی میان صنعت، سیاست‌گذاران و مخاطبان را ایفا می‌کند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

پست های مرتبط

به گزارش آی سی تی نیوز؛  مایکروسافت در تاریخ ۱ اکتبر ۲۰۲۶ (۹ مهر ۱۴۰۵) از مدل پیشرفته خود برای پردازش صوت با نام MAI-Transcribe-2-Streaming رونمایی کرد. این مدل نخستین مدل بلادرنگ مایکروسافت برای تبدیل گفتار به متن محسوب می‌شود که از طریق Azure AI Speech و فقط از طریق API در دسترس قرار گرفته است.

 

رکوردشکنی در بنچمارک AA-WER Streaming

مدل جدید مایکروسافت در بنچمارک AA-WER Streaming موفق شد با ثبت نرخ خطای کلمه‌ای ۲.۵ درصد و زمان پاسخ‌دهی ۰.۱۳ ثانیه، جایگاه نخست را میان ۳۸ مدل رقیب کسب کند. این مدل توانست Grok Voice Transcribe 2.0 متعلق به SpaceXAI را با نرخ خطای ۲.۷۳ درصد و تأخیر ۰.۴۹ ثانیه پشت سر بگذارد.

در مقایسه با سایر رقبا، Muse Voice Transcribe نرخ خطای ۳.۰۶ درصد و تأخیر ۰.۱۶ ثانیه، و ElevenLabs Scribe v2 Realtime نرخ خطای ۳.۵۹ درصد و تأخیر ۰.۱۴ ثانیه را ثبت کرده‌اند.

 

پشتیبانی از ۶۰ زبان با تشخیص خودکار

MAI-Transcribe-2-Streaming از ۶۰ زبان پشتیبانی می‌کند و قابلیت تشخیص خودکار و پیوسته زبان را دارد. این ویژگی به کاربران امکان می‌دهد در میانه گفتگو زبان را تغییر دهند و مدل به‌طور خودکار زبان جدید را تشخیص دهد.

 

قیمت‌گذاری دوگانه برای کاربردهای مختلف

مایکروسافت دو نسخه از این مدل را با قیمت‌های متفاوت ارائه کرده است:

نسخه بلادرنگ (Streaming): قیمت راه‌اندازی ۰.۵۴ دلار به ازای هر ساعت صوتی معادل حدود ۹ دلار برای هر ۱,۰۰۰ دقیقه. این قیمت محدود و تا پایان سال اعتبار دارد.

نسخه دسته‌ای (Batch): مدل MAI-Transcribe-2 با قیمت ۰.۱۰ دلار به ازای هر ساعت صوتی معادل حدود ۱.۶۷ دلار برای هر ۱,۰۰۰ دقیقه. این قیمت نیز محدود و تا پایان سال اعتبار دارد.

 

محصولات هم‌زمان در حوزه تبدیل متن به گفتار

مایکروسافت هم‌زمان دو مدل تبدیل متن به گفتار را نیز معرفی کرد. MAI-Voice-2.1 از ۲۳ زبان پشتیبانی می‌کند و MAI-Voice-2.1-Flash با تأخیر حدود ۱۵۰ میلی‌ثانیه برای کاربردهای بلادرنگ طراحی شده است.

 

تفاوت ادعای مایکروسافت با داده‌های مستقل

نکته قابل توجه این است که ادعای «رتبه نخست» بر اساس داده‌های خودگزارش‌شده مایکروسافت است. در لحظه انتشار، داده مستقل این مدل هنوز در جدول Artificial Analysis ثبت نشده بود و رتبه نخست فعلی همچنان به Grok Voice Transcribe 2.0 با ۲.۷۳ درصد تعلق دارد.

همچنین مایکروسافت در ارزیابی داخلی، زمان ظهور نخستین فرضیه متنی را حدود ۳۲۰ میلی‌ثانیه اعلام کرده، اما در ارزیابی مستقل، تأخیر نهایی ۱۳۰ میلی‌ثانیه ثبت شده است. این دو عدد به دو مرحله متفاوت از فرآیند اشاره دارند.

 

تحلیل ICTNews

ورود مایکروسافت به بازار مدل‌های صوتی بلادرنگ، نشان‌دهنده عزم این شرکت برای رقابت جدی با SpaceXAI و سایر بازیگران این حوزه است. مدل MAI-Transcribe-2-Streaming با نرخ خطای ۲.۵ درصد و تأخیر ۱۳۰ میلی‌ثانیه، از نظر فنی عملکرد قابل‌توجهی ارائه می‌دهد.

نکته هوشمندانه در استراتژی مایکروسافت، ارائه دو نسخه متفاوت از این مدل است. نسخه بلادرنگ با قیمت ۹ دلار برای هر ۱,۰۰۰ دقیقه برای کاربردهای زنده مانند زیرنویس‌گذاری هم‌زمان و دستیارهای صوتی مناسب است، در حالی که نسخه دسته‌ای با قیمت ۱.۶۷ دلار برای پردازش انبوه فایل‌های صوتی طراحی شده است. این تفکیک به مایکروسافت امکان می‌دهد طیف گسترده‌ای از مشتریان را هدف بگیرد.

با این حال، ادعای «رتبه نخست» پیش از تأیید مستقل، می‌تواند برای مایکروسافت ریسک اعتباری ایجاد کند. اگر داده‌های مستقل، عملکرد کمتر از ۲.۵ درصد را نشان دهند، این ادعا می‌تواند به اعتبار شرکت آسیب بزند. همچنین موقتی بودن قیمت‌ها و عدم اعلام قیمت استاندارد پس از پایان سال، برنامه‌ریزی بلندمدت برای توسعه‌دهندگان را دشوار می‌کند.

آخرین اخبار کسب و کار

برچسب ها