اخبار امروز: 111 خبر

فناوری

آنتروپیک کاربران را به چالش کشید: اگر می‌توانید هوش مصنوعی ما را جیلبریک کنید

آنتروپیک از عموم خواسته با شرکت در آزمایش، توانایی سیستم جدید هوش مصنوعی‌اش را به چالش بکشند.

کد خبر: 12595

زمان انتشار: 30 دسامبر 2025 - 05:30 ق.ظ -

2 بازدید

می‌توانید سیستم جدید محافظتی مدل Claude از شرکت Anthropic را شکست دهید؟ پس از ۳ هزار ساعت تلاش بی‌نتیجه در برنامه «Bug Bounty»، این شرکت اکنون به شما این فرصت را می‌دهد تا در آزمایشی عمومی این مدل هوش مصنوعی را به چالش بکشید.

آنتروپیک به‌تازگی سیستم جدیدی موسوم به Constitutional Classifiers معرفی کرده که به گفته‌ این شرکت، می‌تواند تلاش‌ برای شکستن قواعد و محدودیت‌های مدل هوش مصنوعی Claude را فیلتر کند. طبق گزارش «Arstechnica» این سیستم با هدف مقابله با حملات و درخواست‌های غیرمجاز طراحی شده و از زمان آغاز آزمایش‌های داخلی تاکنون، توانسته از بیش از ۳ هزار ساعت تلاش باگ بانتی جلوگیری کند.

این شرکت از همه دعوت کرده وارد عرصه آزمایش شوند و ببینند می‌توانند این مدل را در رسیدن به نتایج غیرمجاز شکست دهند یا خیر. آنتروپیک از کاربران می‌خواهد سعی کنند مدل Claude را به پاسخ‌دادن به 8 سؤال درباره سلاح‌های شیمیایی وادار کنند.

Claude — آنتروپیک کاربران را به چالش کشید: اگر می‌توانید هوش مصنوعی ما را جیلبریک کنید

سیستم جدید آنتروپیک بر پایه مجموعه‌ای از قواعد طبیعی زبان شکل گرفته که اطلاعات مجاز و غیرمجاز برای مدل را تعریف می‌کند. این سیستم به‌گونه‌ای طراحی شده که تلاش‌های کاربران برای دسترسی به اطلاعات حساس را شناسایی و فیلتر کند، حتی اگر به شیوه‌های پیچیده یا در قالب داستان‌های غیرواقعی پنهان شوند.

این سیستم توانسته در برابر ۱۰ هزار حمله شبیه‌سازی‌شده که برای آزمایش آسیب‌پذیری‌های مدل ایجاد شده بودند، واکنش مؤثری نشان دهد. از سوی دیگر، این مدل توانسته ۹۵ درصد این حملات را مسدود کند اما مدل قبلی این میزان موفقیت را فقط با نرخ ۱۴ درصد داشت.

چطور می‌توان مدل Claude را دور زد و قوانین جدید آن را شکست؟

آنتروپیک همچنین برنامه‌ای به نام «Bug Bounty» اجرا کرده و از کارشناسان و متخصصان خواسته بود جیلبریکی طراحی کنند که بتواند سیستم محافظتی مدل Claude را دور بزند. پس از ماه‌ها تلاش، فقط برخی توانسته بودند درباره 5 سؤال از این 10 سؤال طرح‌شده، اطلاعات کاربردی دریافت کنند.

این سیستم جدید به‌رغم موفقیت‌های چشمگیر، به گفته‌ آنتروپیک همچنان نیازمند تلاش‌های مداوم برای مقابله با تکنیک‌های جیلبریک جدید خواهد بود. تیم آنتروپیک مطمئن است سیستمش به‌سرعت می‌تواند برای مقابله با حملات جدید و غیرمجاز به‌روز شود.

آزمایش عمومی این سیستم از ۴ فوریه تا ۱۰ فوریه (16 تا 22 بهمن) ادامه خواهد داشت و در این مدت، کاربران می‌توانند به این آزمایش دسترسی داشته باشند و تلاش کنند پاسخ این سؤالات را بگیرند.

این اقدام آنتروپیک گامی بزرگ در جهت بهبود امنیت و کاهش خطرات ناشی از استفاده نادرست از هوش مصنوعی محسوب می‌شود. ممکن است همچنان راه‌هایی برای دورزدن این سیستم وجود داشته باشد اما سازوکار جدید آنتروپیک به‌طور قابل توجهی تلاش‌ها را پیچیده‌تر کرده است.

نوشته شده توسط: دیجیاتو

اخبار مرتبط

کپی شد

اشتراک گذاری

برترین مطالب روز

امروز جدید
پربازدید اخیر
پربحث این هفته

پردیس نیوز

پردیس نیوز

همه چیز درباره دور دوم مذاکرات ایران و آمریکا

فوری / وزیر خارجه آمریکا تکلیف توافق با ایران را یکسره کرد

ابتکار کمربند و جاده در سایه پیمان ابراهیم/ چرا پیمان ابراهیم به صلح پایدار در خاورمیانه نرسید؟

فوری/ توییتر از دسترس خارج شد

ترامپ شخصاً ناو هواپیما دوم را همراهی کند/ پیشنهاد نماینده تهران درمورد حمله به این ناو

تصویری جدید از موقعیت ناو جرالد فورد در راه ایران / تجهیزات آمریکا زودتر به مقصد می‌رسد!

روایت تازه روبیو از پشت‌پرده مذاکرات با ایران

سپاه بیانیه صادر کرد / در مراسم چهلم جان‌باختگان ۱۸ و ۱۹ دی‌۱۴۰۴ شرکت کنید

کاندوم؛ یادگاری عجیب المپیک میلان 2026

پرسپولیس پاسخ استعفای اوسمار را داد

درباره مـا

به‌روز فان از سال ۱۳۹۱ رسانه‌ای در حوزه ارائه روزانه مطالب سرگرم‌کننده و فان است که با انتشار محتوای جذاب، متنوع و مناسب برای علاقه‌مندان به سرگرمی و تفریح سالم در فضای دیجیتال، لحظه‌های شاد، خلاق و اجتماعی و ترندهای روز را برای مخاطبان روایت می‌کند.

اطلاعات به‌روز فان

مطالب مدرن روز

اخبار فرهنگ و جامعه

خبرنامه و شبکه های اجتماعی

برای دریافت جدیدترین مطالب ایمیل خود را وارد کنید.
هیچ ایمیل تبلیغاتی ارسال نخواهد شد.

عضویت در خبرنامه

آخرین خبرها را میتوانید از طریق اپلیکیشن موبایل دریافت کنید

تمامی حقوق مادی و معنوی این وب‌سایت متعلق به مجله «به‌روز فان» است و استفاده از مطالب آن تنها برای مقاصد غیرتجاری و با ذکر منبع بلامانع می‌باشد.