به گزارش آی سی تی نیوز؛ مایکروسافت در تاریخ ۱ اکتبر ۲۰۲۶ (۹ مهر ۱۴۰۵) از مدل پیشرفته خود برای پردازش صوت با نام MAI-Transcribe-2-Streaming رونمایی کرد. این مدل نخستین مدل بلادرنگ مایکروسافت برای تبدیل گفتار به متن محسوب میشود که از طریق Azure AI Speech و فقط از طریق API در دسترس قرار گرفته است.
رکوردشکنی در بنچمارک AA-WER Streaming
مدل جدید مایکروسافت در بنچمارک AA-WER Streaming موفق شد با ثبت نرخ خطای کلمهای ۲.۵ درصد و زمان پاسخدهی ۰.۱۳ ثانیه، جایگاه نخست را میان ۳۸ مدل رقیب کسب کند. این مدل توانست Grok Voice Transcribe 2.0 متعلق به SpaceXAI را با نرخ خطای ۲.۷۳ درصد و تأخیر ۰.۴۹ ثانیه پشت سر بگذارد.
در مقایسه با سایر رقبا، Muse Voice Transcribe نرخ خطای ۳.۰۶ درصد و تأخیر ۰.۱۶ ثانیه، و ElevenLabs Scribe v2 Realtime نرخ خطای ۳.۵۹ درصد و تأخیر ۰.۱۴ ثانیه را ثبت کردهاند.
پشتیبانی از ۶۰ زبان با تشخیص خودکار
MAI-Transcribe-2-Streaming از ۶۰ زبان پشتیبانی میکند و قابلیت تشخیص خودکار و پیوسته زبان را دارد. این ویژگی به کاربران امکان میدهد در میانه گفتگو زبان را تغییر دهند و مدل بهطور خودکار زبان جدید را تشخیص دهد.
قیمتگذاری دوگانه برای کاربردهای مختلف
مایکروسافت دو نسخه از این مدل را با قیمتهای متفاوت ارائه کرده است:
نسخه بلادرنگ (Streaming): قیمت راهاندازی ۰.۵۴ دلار به ازای هر ساعت صوتی معادل حدود ۹ دلار برای هر ۱,۰۰۰ دقیقه. این قیمت محدود و تا پایان سال اعتبار دارد.
نسخه دستهای (Batch): مدل MAI-Transcribe-2 با قیمت ۰.۱۰ دلار به ازای هر ساعت صوتی معادل حدود ۱.۶۷ دلار برای هر ۱,۰۰۰ دقیقه. این قیمت نیز محدود و تا پایان سال اعتبار دارد.
محصولات همزمان در حوزه تبدیل متن به گفتار
مایکروسافت همزمان دو مدل تبدیل متن به گفتار را نیز معرفی کرد. MAI-Voice-2.1 از ۲۳ زبان پشتیبانی میکند و MAI-Voice-2.1-Flash با تأخیر حدود ۱۵۰ میلیثانیه برای کاربردهای بلادرنگ طراحی شده است.
تفاوت ادعای مایکروسافت با دادههای مستقل
نکته قابل توجه این است که ادعای «رتبه نخست» بر اساس دادههای خودگزارششده مایکروسافت است. در لحظه انتشار، داده مستقل این مدل هنوز در جدول Artificial Analysis ثبت نشده بود و رتبه نخست فعلی همچنان به Grok Voice Transcribe 2.0 با ۲.۷۳ درصد تعلق دارد.
همچنین مایکروسافت در ارزیابی داخلی، زمان ظهور نخستین فرضیه متنی را حدود ۳۲۰ میلیثانیه اعلام کرده، اما در ارزیابی مستقل، تأخیر نهایی ۱۳۰ میلیثانیه ثبت شده است. این دو عدد به دو مرحله متفاوت از فرآیند اشاره دارند.
تحلیل ICTNews
ورود مایکروسافت به بازار مدلهای صوتی بلادرنگ، نشاندهنده عزم این شرکت برای رقابت جدی با SpaceXAI و سایر بازیگران این حوزه است. مدل MAI-Transcribe-2-Streaming با نرخ خطای ۲.۵ درصد و تأخیر ۱۳۰ میلیثانیه، از نظر فنی عملکرد قابلتوجهی ارائه میدهد.
نکته هوشمندانه در استراتژی مایکروسافت، ارائه دو نسخه متفاوت از این مدل است. نسخه بلادرنگ با قیمت ۹ دلار برای هر ۱,۰۰۰ دقیقه برای کاربردهای زنده مانند زیرنویسگذاری همزمان و دستیارهای صوتی مناسب است، در حالی که نسخه دستهای با قیمت ۱.۶۷ دلار برای پردازش انبوه فایلهای صوتی طراحی شده است. این تفکیک به مایکروسافت امکان میدهد طیف گستردهای از مشتریان را هدف بگیرد.
با این حال، ادعای «رتبه نخست» پیش از تأیید مستقل، میتواند برای مایکروسافت ریسک اعتباری ایجاد کند. اگر دادههای مستقل، عملکرد کمتر از ۲.۵ درصد را نشان دهند، این ادعا میتواند به اعتبار شرکت آسیب بزند. همچنین موقتی بودن قیمتها و عدم اعلام قیمت استاندارد پس از پایان سال، برنامهریزی بلندمدت برای توسعهدهندگان را دشوار میکند.