مدل جدید Muse Voice Transcribe میتواند گفتار بیش از ۲۰ نفر و بیش از ۲۰ زبان را بهصورت همزمان رونویسی کند.
متا مدل جدیدی برای رونویسی لحظهای صدا با نام Muse Voice Transcribe معرفی کرد که به گفته این شرکت میتواند گفتار بیش از ۲۰ گوینده را تشخیص دهد و همزمان با چند زبان کار کند. این مدل همچنین میتواند هنگام تغییر زبان در میانه جمله، زبانهای مختلف را تشخیص دهد و متن را بر همان اساس رونویسی کند.
Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ متا است و برای تبدیل گفتار به متن در حالت استریم طراحی شده است. این مدل قابلیتهایی مانند تفکیک گویندگان و تشخیص زمان پایان گفتار را در یک مدل واحد ارائه میکند.
مدل تبدیل گفتار به متن متا: Muse Voice Transcribe
«مارک زاکربرگ»، مدیرعامل متا، نمونهای از عملکرد این مدل را در شبکه اجتماعی ایکس منتشر کرده است. در این ویدیو، سیستم میتواند چند گوینده را از یکدیگر تشخیص دهد و هنگام صحبتکردن افراد به زبانهای مختلف، زبان گفتار را بهصورت خودکار تغییر دهد.
این مدل همچنین از قابلیتی موسوم به تغییر زبانی پشتیبانی میکند؛ به این معنا که اگر فردی در یک جمله از واژههای چند زبان استفاده کند، سیستم میتواند این تغییر را تشخیص دهد و جمله را رونویسی کند.
زاکربرگ درباره نحوه عملکرد مدل توضیح داده است: «مدل تصمیم میگیرد چه زمانی گوش بدهد. برای واژههای دشوار کمی بیشتر صبر میکند و برای واژههای ساده سریعتر نتیجه را ثبت میکند.» به گفته او، این فرایند با استفاده از تأخیر تطبیقی انجام میشود تا مدل بتواند توکن بعدی را پیشبینی و دقت رونویسی را افزایش دهد.
زاکربرگ همچنین گفته است مدل برای کار با صدای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان آموزش داده شده است. به گفته او، Muse Voice Transcribe میتواند جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.

متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از معرفی مدل صوتی Gemini 3.5 Transcribe گوگل انجام داده است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامهای برای استفاده از Muse Voice Transcribe در سرویسهای اصلی خود دارد.
درحالحاضر، کاربران میتوانند قابلیتهای این مدل را در اپلیکیشن دسکتاپ Meta AI برای مک تجربه کنند. این مدل برای توسعهدهندگان نیز از طریق Muse Code و Model API متا در دسترس است. هزینه استفاده از API برابر با ۳ دلار به ازای هر هزار دقیقه صوت اعلام شده است.
