محققان متا، دانشگاه دوک و دانشگاه کالیفرنیا، دیویس، ایده جدیدی برای بهبود عاملهای هوش مصنوعی دارند. به جای تمرکز بر خود مدل، آنها پیشنهاد میکنند که چارچوب اطراف مدل را بهبود بخشند و از چندین تیم خود-بهبوددهنده به جای یک تیم واحد استفاده کنند.
بهبود عملکرد عاملهای هوش مصنوعی با رویکرد چند شاخهای
پیشچاپ این تحقیق با عنوان «ترکیبی از شاخههای خود-بهبوددهنده برای بهینهسازی چارچوب عامل» (Mixture of Self-Improving Branches for Agent Harness Optimization)، بهبود ۳۴.۸ درصدی نسبی را در استدلال ریاضی در سطح المپیاد گزارش کرده است. این رویکرد دقت مدل Gemini 3 Flash را از ۴۶.۰ درصد به ۶۲.۰ درصد افزایش داده است، بدون اینکه نیازی به بازآموزی خود مدل باشد.
به طور رسمیتر، «چارچوب عامل» (agent harness) به چارچوب کدنویسی گفته میشود که مدل زبان بزرگ را احاطه میکند. این چارچوب شامل دستورات (prompts) دریافتی مدل، ابزارهایی که میتواند فراخوانی کند، متنی که برای مشاهده در اختیار دارد و نحوه اجرای اقداماتش میشود.
«بهینهسازی چارچوب» (harness optimization) به عمل جستجوی خودکار برای نسخه بهتر این پوشش کد اشاره دارد. مقاله جدید که در تاریخ ۲۹ سپتامبر ۲۰۲۶ در arXiv با شناسه 2609.37834v1 منتشر شده است، مستقیماً بر اساس سیستمی پیشین به نام Meta-Harness بنا شده است.
Meta-Harness که در تاریخ ۳۰ مارس ۲۰۲۶ منتشر شد، پیش از این در معیارهای مختلف عملکرد بهتری نسبت به روشهای سنتی داشته است. کار جدید استدلال میکند که یک مسیر جستجوی واحد، بخشی از پتانسیل عملکرد را نادیده میگیرد.
بنابراین، محققان جستجو را به چندین شاخه تخصصی تقسیم کردند. هر شاخه به طور مستقل تکامل مییابد، با زیرمجموعهای متمایز از دادههای توسعه و سیاست خاص خود برای پیشنهاد تغییرات.
این شاخهها همچنین از تاریخچه خود درس میگیرند. هر شاخه مواردی را که در آنها بر رقبای خود برتری یافته است، حفظ میکند و استراتژی خود را بر اساس عملکرد تلاشهای قبلی اصلاح میکند.
این موضوع سوال واضحی را مطرح میکند: چه کسی متخصص را انتخاب میکند؟ پاسخ یک «مسیریاب» (router) است. در زمان استقرار، این مسیریاب بهترین سر شاخه را برای هر ورودی دریافتی انتخاب میکند.
کل فرآیند فقط بر روی دادههای مجموعه توسعه اجرا میشود. نویسندگان گزارش میدهند که چارچوبهای مکمل، بهبودهای خود را بدون هیچ دسترسی به مجموعه آزمون ارائه کردهاند.
نتیجه برجسته در استدلال ریاضی در سطح المپیاد به دست آمد. دقت با استفاده از Gemini 3 Flash از ۴۶.۰ درصد به ۶۲.۰ درصد افزایش یافت، که نویسندگان آن را به عنوان یک بهبود ۳۴.۸ درصدی نسبی توصیف میکنند.
این بهبودها به وظایف عاملی نیز منتقل شد. در Terminal-Bench 2.0، که عاملها را در محیط خط فرمان آزمایش میکند، این سیستم افزایش ۱۱.۶ درصدی را ثبت کرد.
SWE-bench Lite، یک معیار مهندسی نرمافزار، افزایش ۳.۸ درصدی را نشان داد.
فهرست نویسندگان شامل Haoyu Dong، وابسته به Meta و دانشگاه دوک، و Zihao Lin، وابسته به Meta و UC Davis است. Lizhu Zhang و Zhuokai Zhao به عنوان نویسندگان مشترک آخر ذکر شدهاند.
این مقاله یک پیشچاپ است که در arXiv منتشر شده است. این بدان معناست که به صورت عمومی به اشتراک گذاشته شده است، اما لزوماً تحت بررسی رسمی همتایان قرار نگرفته است.
جهش از ۴۶.۰ درصد به ۶۲.۰ درصد در ریاضیات دشوار، که بدون دستکاری وزنهای مدل به دست آمده است، نشان میدهد که بهبودهای معنیدار میتواند از مهندسی محیطی که مدل در آن عمل میکند، حاصل شود.
سوالات باز و قابل توجهی وجود دارد. اجرای و نگهداری چندین شاخه در حال تکامل به همراه یک مسیریاب احتمالاً پیچیدگی را افزایش میدهد، و نتایج مقاله از معیارهای خاص و یک مدل خاص به دست آمده است.
Meta-Harness در مارس ۲۰۲۶ عرضه شد و در آن زمان نیز از روشهای سنتی پیشی گرفته بود. تقریباً شش ماه بعد، جانشین آن ادعا میکند که از خود Meta-Harness بهتر عمل میکند.



