محققان متا، دوک و یو‌سی دیویس شاخه‌های خودبهبود برای بهینه‌سازی عامل رونمایی کردند
آپگیتمثبتنوآوری فناوریاخبار

محققان متا، دوک و یو‌سی دیویس شاخه‌های خودبهبود برای بهینه‌سازی عامل رونمایی کردند

زمان مطالعه: ۴ دقیقه

محققان متا، دانشگاه دوک و دانشگاه کالیفرنیا، دیویس، ایده جدیدی برای بهبود عامل‌های هوش مصنوعی دارند. به جای تمرکز بر خود مدل، آن‌ها پیشنهاد می‌کنند که چارچوب اطراف مدل را بهبود بخشند و از چندین تیم خود-بهبوددهنده به جای یک تیم واحد استفاده کنند.

بهبود عملکرد عامل‌های هوش مصنوعی با رویکرد چند شاخه‌ای

پیش‌چاپ این تحقیق با عنوان «ترکیبی از شاخه‌های خود-بهبوددهنده برای بهینه‌سازی چارچوب عامل» (Mixture of Self-Improving Branches for Agent Harness Optimization)، بهبود ۳۴.۸ درصدی نسبی را در استدلال ریاضی در سطح المپیاد گزارش کرده است. این رویکرد دقت مدل Gemini 3 Flash را از ۴۶.۰ درصد به ۶۲.۰ درصد افزایش داده است، بدون اینکه نیازی به بازآموزی خود مدل باشد.

به طور رسمی‌تر، «چارچوب عامل» (agent harness) به چارچوب کدنویسی گفته می‌شود که مدل زبان بزرگ را احاطه می‌کند. این چارچوب شامل دستورات (prompts) دریافتی مدل، ابزارهایی که می‌تواند فراخوانی کند، متنی که برای مشاهده در اختیار دارد و نحوه اجرای اقداماتش می‌شود.

«بهینه‌سازی چارچوب» (harness optimization) به عمل جستجوی خودکار برای نسخه بهتر این پوشش کد اشاره دارد. مقاله جدید که در تاریخ ۲۹ سپتامبر ۲۰۲۶ در arXiv با شناسه 2609.37834v1 منتشر شده است، مستقیماً بر اساس سیستمی پیشین به نام Meta-Harness بنا شده است.

Meta-Harness که در تاریخ ۳۰ مارس ۲۰۲۶ منتشر شد، پیش از این در معیارهای مختلف عملکرد بهتری نسبت به روش‌های سنتی داشته است. کار جدید استدلال می‌کند که یک مسیر جستجوی واحد، بخشی از پتانسیل عملکرد را نادیده می‌گیرد.

بنابراین، محققان جستجو را به چندین شاخه تخصصی تقسیم کردند. هر شاخه به طور مستقل تکامل می‌یابد، با زیرمجموعه‌ای متمایز از داده‌های توسعه و سیاست خاص خود برای پیشنهاد تغییرات.

این شاخه‌ها همچنین از تاریخچه خود درس می‌گیرند. هر شاخه مواردی را که در آن‌ها بر رقبای خود برتری یافته است، حفظ می‌کند و استراتژی خود را بر اساس عملکرد تلاش‌های قبلی اصلاح می‌کند.

این موضوع سوال واضحی را مطرح می‌کند: چه کسی متخصص را انتخاب می‌کند؟ پاسخ یک «مسیریاب» (router) است. در زمان استقرار، این مسیریاب بهترین سر شاخه را برای هر ورودی دریافتی انتخاب می‌کند.

کل فرآیند فقط بر روی داده‌های مجموعه توسعه اجرا می‌شود. نویسندگان گزارش می‌دهند که چارچوب‌های مکمل، بهبودهای خود را بدون هیچ دسترسی به مجموعه آزمون ارائه کرده‌اند.

نتیجه برجسته در استدلال ریاضی در سطح المپیاد به دست آمد. دقت با استفاده از Gemini 3 Flash از ۴۶.۰ درصد به ۶۲.۰ درصد افزایش یافت، که نویسندگان آن را به عنوان یک بهبود ۳۴.۸ درصدی نسبی توصیف می‌کنند.

این بهبودها به وظایف عاملی نیز منتقل شد. در Terminal-Bench 2.0، که عامل‌ها را در محیط خط فرمان آزمایش می‌کند، این سیستم افزایش ۱۱.۶ درصدی را ثبت کرد.

SWE-bench Lite، یک معیار مهندسی نرم‌افزار، افزایش ۳.۸ درصدی را نشان داد.

فهرست نویسندگان شامل Haoyu Dong، وابسته به Meta و دانشگاه دوک، و Zihao Lin، وابسته به Meta و UC Davis است. Lizhu Zhang و Zhuokai Zhao به عنوان نویسندگان مشترک آخر ذکر شده‌اند.

این مقاله یک پیش‌چاپ است که در arXiv منتشر شده است. این بدان معناست که به صورت عمومی به اشتراک گذاشته شده است، اما لزوماً تحت بررسی رسمی همتایان قرار نگرفته است.

جهش از ۴۶.۰ درصد به ۶۲.۰ درصد در ریاضیات دشوار، که بدون دستکاری وزن‌های مدل به دست آمده است، نشان می‌دهد که بهبودهای معنی‌دار می‌تواند از مهندسی محیطی که مدل در آن عمل می‌کند، حاصل شود.

سوالات باز و قابل توجهی وجود دارد. اجرای و نگهداری چندین شاخه در حال تکامل به همراه یک مسیریاب احتمالاً پیچیدگی را افزایش می‌دهد، و نتایج مقاله از معیارهای خاص و یک مدل خاص به دست آمده است.

Meta-Harness در مارس ۲۰۲۶ عرضه شد و در آن زمان نیز از روش‌های سنتی پیشی گرفته بود. تقریباً شش ماه بعد، جانشین آن ادعا می‌کند که از خود Meta-Harness بهتر عمل می‌کند.

برچسب‌ها:آپگیتمثبتنوآوری فناوریاخبار
کپی شد

مقالات مرتبط

بانکداران هنگ‌کنگ تعطیلات تابستانی را به دلیل هوش مصنوعی و جذب سرمایه بی‌سابقه لغو کردند
آپگیتاقتصاد کلانخنثیاخبار

بانکداران هنگ‌کنگ تعطیلات تابستانی را به دلیل هوش مصنوعی و جذب سرمایه بی‌سابقه لغو کردند

هنگ کنگ رکورد جذب سرمایه در بازارهای سهام را شکست؛ هوش مصنوعی موتور محرکه اصلی بازارهای سرمایه سهام هنگ کنگ در سه ماهه سوم سال ۲۰۲۶ (ژوئیه تا سپتامبر) با جذب ۴۷.۵ میلیارد دلار، رکورد جدیدی را به ثبت ر

ادامه مطلب
ریپل با پشتوانه XRP آسیا را برای تسریع پذیرش XRPL راه‌اندازی کرد
آپگیتپذیرش و همکاریمثبتاخبار

ریپل با پشتوانه XRP آسیا را برای تسریع پذیرش XRPL راه‌اندازی کرد

راه‌اندازی XRP Asia با حمایت ریپل و بنیاد XRP Ledger برای گسترش پذیرش در منطقه آسیا-اقیانوسیه سازمان XRP Asia با حمایت شرکت ریپل (Ripple) و بنیاد XRP Ledger (XRP Ledger Foundation) راه‌اندازی شد تا پذ

ادامه مطلب
نیروی ابرهوش آمریکا: ۱۲۰ روز برای گزارش ریسک‌های هوش مصنوعی
آپگیتخنثیرگولاتوری و سیاستاخبار

نیروی ابرهوش آمریکا: ۱۲۰ روز برای گزارش ریسک‌های هوش مصنوعی

واشنگتن نیروی جدیدی دارد، و این بار آسمان را هدف نگرفته است. طبق گزارش بلومبرگ، «نیروی هوش برتر» ۱۲۰ روز فرصت دارد تا گزارشی درباره خطرات هوش مصنوعی تهیه کند. این نیرو همزمان با تلاش برای تغییر نام‌گذ

ادامه مطلب