اخبار امروز: 32 خبر

فناوری

هوش مصنوعی FantasyTalking معرفی شد؛ ساخت شخصیت‌های سخنگوی واقع‌گرایانه [تماشا کنید]

هوش مصنوعی جدید چینی‌ها فقط با یک تصویر و فایل صوتی، ویدیوهایی واقع‌گرایانه با حرکات دقیق لب، چهره، بدن و پس‌زمینه تولید می‌کند.

کد خبر: 11695

زمان انتشار: 30 دسامبر 2025 - 04:40 ق.ظ -

2 بازدید

محققان چینی هوش مصنوعی از مدلی نوآورانه با نام FantasyTalking رونمایی کرده‌اند که می‌تواند فقط با یک تصویر پرتره ثابت، ویدیوهایی واقع‌گرایانه و قابل‌کنترل از چهره‌های درحال صحبت‌ تولید کند. این مدل از معماری پیشرفته مبتنی‌بر Video Diffusion Transformer بهره می‌برد و با استفاده از تکنیک‌های هماهنگ‌سازی صوتی-تصویری، هماهنگی دقیقی میان حرکات لب، حالات چهره، حرکات بدن و صدای ورودی ایجاد می‌کند.

طبق توضیحات صفحه Github این پروژه، در قلب آن استراتژی دومرحله‌ای برای همگام‌سازی صوت و تصویر وجود دارد.

نحوه تولید آواتار سخنگو توسط هوش مصنوعی FantasyTalking

در مرحله اول، مدل با آموزش در سطح کلیپ، حرکات کلی صحنه شامل چهره، اشیای اطراف و پس‌زمینه را با صدای ورودی هماهنگ می‌کند. در مرحله دوم، جزئیات حرکات لب با دقت فریم‌به‌فریم و با استفاده از ماسک‌های خاصی اصلاح می‌شود تا کامل با صدا منطبق شود.

یکی از چالش‌های اساسی در حوزه‌ گرافیک و بینایی ماشین تولید آواتارهای متحرک از تصویر ثابت بوده است. اغلب روش‌های قبلی برای حفظ واقع‌گرایی و هماهنگی با صدا، از مدل‌های سه‌بعدی میانجی مثل 3DMM یا FLAME استفاده می‌کردند اما این روش‌ها در بازتولید حرکات ظریف صورت و انیمیشن‌های طبیعی ناکارآمد بودند.

در ویدیو زیر می‌توانید برخی نمونه‌های ساخته‌ این مدل و مدل‌های دیگر را با هم مقایسه کنید:

FantasyTalking همچنین از ماژول ویژه برای کنترل شدت حرکات بهره می‌برد که امکان تنظیم میزان انیمیشن حالات چهره و بدن را فراهم می‌کند. این ویژگی تولید ویدیوهایی فراتر از حرکت لب‌ها را ممکن می‌کند. برخلاف بسیاری از مدل‌های دیگر، این سیستم برای حفظ هویت چهره از مکانیزمی مبتنی‌بر چهره استفاده می‌کند که نتایج طبیعی‌تر و یکپارچه‌تری ارائه می‌دهد.

از دیگر توانایی‌های این مدل می‌توان به تولید ویدیوهای حرف‌زدن شخصیت‌ها با زوایای مختلف (نمای نزدیک، نیم‌تنه، تمام‌قد، از روبه‌رو یا زاویه‌دار)، پشتیبانی از استایل‌های گرافیکی مختلف (واقع‌گرایانه یا کارتونی) و حتی متحرک‌سازی (Animate) حیوانات اشاره کرد.

در مقایسه با روش‌های بسته و پیشرفته‌ای مانند OmniHuman-1، مدل FantasyTalking از نظر واقع‌گرایی، حفظ هویت، انسجام حرکتی و تطابق صوتی-تصویری کیفیت بالاتری ارائه می‌دهد.

نوشته شده توسط: دیجیاتو

اخبار مرتبط

کپی شد

اشتراک گذاری

برترین مطالب روز

امروز جدید
پربازدید اخیر
پربحث این هفته

پردیس نیوز

پردیس نیوز

بدرقه ساکت و بی‌حضور چهره‌ها برای عنایت بخشی در تالار وحدت

اظهارات معنادار ترامپ پیش از مذاکرات: ایران نمی‌خواهد بهای عدم توافق را بدهد

تحرکات نظامی آمریکا در خاورمیانه / حضور نظامی تمدید شد

دور دوم دیپلماسی در ژنو؛ سناریوهای پیش‌روی مذاکرات هسته‌ای ایران و آمریکا

شب مرگ و زندگی استقلال / آبی‌ها حذف می‌شوند؟

«نبرد عبرت‌آموز»: ایران چگونه معادلات جنگ را دگرگون کرده است؟

فارس: سه نفتکش توقیف شده توسط هند ارتباطی با ایران ندارد

ایران گنبد جدید حرم امام حسین (ع) را با طلا ساخت / طلاهای گنبد از کجا تأمین شد؟

زمان ورود ناو آمریکایی به منطقه مشخص شد؟ / اعلام وضعیت فوق العاده

آیا حماس خلع سلاح خواهد شد؟/ پاسخ رهبران حماس به آخرین مهلت خلع سلاح

درباره مـا

به‌روز فان از سال ۱۳۹۱ رسانه‌ای در حوزه ارائه روزانه مطالب سرگرم‌کننده و فان است که با انتشار محتوای جذاب، متنوع و مناسب برای علاقه‌مندان به سرگرمی و تفریح سالم در فضای دیجیتال، لحظه‌های شاد، خلاق و اجتماعی و ترندهای روز را برای مخاطبان روایت می‌کند.

اطلاعات به‌روز فان

مطالب مدرن روز

اخبار فرهنگ و جامعه

خبرنامه و شبکه های اجتماعی

برای دریافت جدیدترین مطالب ایمیل خود را وارد کنید.
هیچ ایمیل تبلیغاتی ارسال نخواهد شد.

عضویت در خبرنامه

آخرین خبرها را میتوانید از طریق اپلیکیشن موبایل دریافت کنید

تمامی حقوق مادی و معنوی این وب‌سایت متعلق به مجله «به‌روز فان» است و استفاده از مطالب آن تنها برای مقاصد غیرتجاری و با ذکر منبع بلامانع می‌باشد.