- آنتروپیک از مدلهای Fable 5.1 و Mythos 5.1 رونمایی کرد؛ قدرتمندتر با هزینه کمتر
- Runway مدل Solaris را معرفی کرد؛ ساخت رابطهای تعاملی بدون کدنویسی [تماشا کنید]
- OpenAI اطلاعات بیشتری درباره توانمندیهای شگفتانگیز مدل Astra منتشر کرد
- متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان
- اخطار دادستان تهران به اجارهدهندگان کارتهای بازرگانی
- قند کمتر در کودکی، مغز سالمتر در سالمندی
- وقتی لباس سفید عروس ایرانی سیاه میشود؛ از «در چشم باد» تا عروسی سیریک
- تریلر جدید Ace Combat 8: Wings of Theve بخش «Online 101» را معرفی میکند
- خریداران هدست Steam Frame احتمالا بازی Half-Life: Alyx را به عنوان هدیه دریافت خواهند کرد
- بازیهای جدید سرویس گیم پس در ماه سپتامبر ۲۰۲۶ معرفی شدند
متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان
متا مدل جدیدی برای رونویسی لحظهای صدا با نام Muse Voice Transcribe معرفی کرد که به گفته این شرکت میتواند گفتار بیش از ۲۰ گوینده را تشخیص دهد و همزمان با چند زبان کار کند. این مدل همچنین میتواند هنگام تغییر زبان در میانه جمله، زبانهای مختلف را تشخیص دهد و متن را بر همان اساس رونویسی کند.
Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ متا است و برای تبدیل گفتار به متن در حالت استریم طراحی شده است. این مدل قابلیتهایی مانند تفکیک گویندگان و تشخیص زمان پایان گفتار را در یک مدل واحد ارائه میکند.
مدل تبدیل گفتار به متن متا: Muse Voice Transcribe
«مارک زاکربرگ»، مدیرعامل متا، نمونهای از عملکرد این مدل را در شبکه اجتماعی ایکس منتشر کرده است. در این ویدیو، سیستم میتواند چند گوینده را از یکدیگر تشخیص دهد و هنگام صحبتکردن افراد به زبانهای مختلف، زبان گفتار را بهصورت خودکار تغییر دهد.
این مدل همچنین از قابلیتی موسوم به تغییر زبانی پشتیبانی میکند؛ به این معنا که اگر فردی در یک جمله از واژههای چند زبان استفاده کند، سیستم میتواند این تغییر را تشخیص دهد و جمله را رونویسی کند.
زاکربرگ درباره نحوه عملکرد مدل توضیح داده است: «مدل تصمیم میگیرد چه زمانی گوش بدهد. برای واژههای دشوار کمی بیشتر صبر میکند و برای واژههای ساده سریعتر نتیجه را ثبت میکند.» به گفته او، این فرایند با استفاده از تأخیر تطبیقی انجام میشود تا مدل بتواند توکن بعدی را پیشبینی و دقت رونویسی را افزایش دهد.
زاکربرگ همچنین گفته است مدل برای کار با صدای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان آموزش داده شده است. به گفته او، Muse Voice Transcribe میتواند جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.

متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از معرفی مدل صوتی Gemini 3.5 Transcribe گوگل انجام داده است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامهای برای استفاده از Muse Voice Transcribe در سرویسهای اصلی خود دارد.
درحالحاضر، کاربران میتوانند قابلیتهای این مدل را در اپلیکیشن دسکتاپ Meta AI برای مک تجربه کنند. این مدل برای توسعهدهندگان نیز از طریق Muse Code و Model API متا در دسترس است. هزینه استفاده از API برابر با ۳ دلار به ازای هر هزار دقیقه صوت اعلام شده است.
- آنتروپیک از مدلهای Fable 5.1 و Mythos 5.1 رونمایی کرد؛ قدرتمندتر با هزینه کمتر
- Runway مدل Solaris را معرفی کرد؛ ساخت رابطهای تعاملی بدون کدنویسی [تماشا کنید]
- OpenAI اطلاعات بیشتری درباره توانمندیهای شگفتانگیز مدل Astra منتشر کرد
- کره جنوبی و عربستان به شهروندان خود ابزارهای هوش مصنوعی رایگان میدهند
- گوگل از قابلیت جدید Boost در Antigravity برای انجام کارهای پیچیده رونمایی کرد [تماشا کنید]
- ۵ کشف نگرانکننده از تحقیقات OpenAI درباره نفوذ ایجنتها به هاگینگ فیس
- مطالعه جدید: تعامل زیاد با هوش مصنوعی رفتار انسان را شبیه رباتها میکند
- ابزار هوش مصنوعی OpenClaw 2.0 با فرایند نصب سادهتر و قابلیتهای جدید منتشر شد
- استتار دیجیتال؛ این پیراهن عجیب شما را در برابر دوربینهای هوش مصنوعی نامرئی میکند
- برخورد اینستاگرام با اینفلوئنسرهای هوش مصنوعی که خود را انسان جا میزنند
