محققان مایکروسافت روشی نوین برای بهینهسازی پرامپتهای عاملهای هوش مصنوعی معرفی کردند
محققان مایکروسافت در مقالهای با عنوان «عاملهای کدنویس، بهینهسازهای قوی پرامپت هستند» که در تاریخ ۲۳ سپتامبر ۲۰۲۶ منتشر شد، روشی به نام «تقطیر مهارت عامل کدنویس» (Coding-Agent Skill Distillation) یا به اختصار CASD را معرفی کردهاند. این روش قادر است پرامپتهای سیستمی بهبودیافته را مستقیماً از مجموعهای ایستا از گزارشهای ذخیرهشده عاملها استخراج کند و این کار را با هزینهای حدود ۱.۶۰ دلار برای هر بار اجرا انجام میدهد.
اهمیت این قیمتگذاری زمانی مشخص میشود که بدانیم رقابت در این حوزه ارزان نیست. طبق این مقاله، CASD بیش از ۲۲ برابر ارزانتر از روشهای تکرارشونده مبتنی بر اعتبارسنجی (validation-gated iterative methods) است؛ رویکرد آزمون و خطا که به استاندارد رایج برای تنظیم پرامپتهای عاملها تبدیل شده است.
CASD نیازی به جستجوی تکرارشونده، تعامل زنده با محیط، و یا مجموعه داده اعتبارسنجی مجزا ندارد. در عوض، یک عامل کدنویس کل مجموعه دادههای ذخیرهشده (trajectories) را که شامل سوابق اقدامات عامل در وظایف گذشته است، دریافت میکند. این عامل یک تحلیل آماری واحد در سطح کل مجموعه داده انجام میدهد و آمار تجمیعی، الگوهای شکست مکرر، و نمونههای نماینده را استخراج میکند. از این تحلیل، قوانین رفتاری را تقطیر کرده و آنها را در قالب یک پرامپت بهینهشده مینویسد.
محققان این رویکرد را به «مطالعه کل مجموعه داده» تشبیه میکنند، در مقابل «پردازش دستههای کوچک داده» (minibatches). بهینهسازهای تکرارشونده معمولاً دادهها را در قطعات کوچک بررسی میکنند که این امر شناسایی الگوهایی را که تنها در تعداد زیادی از اپیزودها ظاهر میشوند، دشوار میسازد.
نتیجه برجسته این روش، میانگین افزایش ۱۶.۶ درصدی نسبت به خط پایه بدون بهینهسازی است. CASD همچنین در معیارهای مختلف، از جستجوی بازتابی مبتنی بر اعتبارسنجی به سبک SkillOpt پیشی گرفت.
در مقایسه با GEPA، یک بهینهساز پرامپت بازتابی پرکاربرد، CASD در سه مورد از چهار معیار عاملمحور پیروز شد.
این مقاله همچنین بیان میکند که CASD حتی زمانی که رقبای آن دارای دادههای اعتبارسنجی اضافی و دسترسی نامحدود به محیط بودند، برتری خود را نسبت به روشهای رقیب حفظ کرد.
این تحقیق، GEPA را به عنوان روشی که به طور گسترده در شرکتهایی از جمله Databricks، Shopify، Dropbox و OpenAI مورد استفاده قرار میگیرد، توصیف کرده و موفقیتهای قابل توجهی را در کارهای متنباز به آن نسبت میدهد.
این مقاله توسط محققان مایکروسافت، آگامدیپ سینگ، سریشتی گوتام، پریانشو گوپتا، نیکیت
ا مهروترا، تانمای باکشی و سومیت گولوانی تهیه شده است. این تحقیق بر پایه کار مرتبط مایکروسافت به نام SkillOpt بنا شده است که در آن مهارتهای عامل به عنوان پارامترهای متنی قابل آموزش در نظر گرفته میشوند و در مقالهای که در ژوئن ۲۰۲۶ منتشر شد، معرفی گردید.
SkillOpt نماینده رویکرد تکرارشونده مبتنی بر اعتبارسنجی است. CASD در واقع استدلالی از سوی مایکروسافت است که در بسیاری از موارد، رویکرد قبلی خودشان کار بیشتری نسبت به حد لازم میطلبد.
اگر یک بار تحلیل واحد با هزینه تقریبی ۱.۶۰ دلار بتواند در اکثر وظایف آزمایششده با بهینهسازی تکرارشونده برابری کند یا از آن پیشی بگیرد، استدلال برای حلقههای تنظیم پرهزینه دشوارتر میشود.
حذف نیاز به دادههای اعتبارسنجی مجزا، بار آمادهسازی قابل توجهی را از بین میبرد. همچنین، عدم نیاز به تعامل زنده با محیط، ریسک را کاهش میدهد، زیرا بهینهسازهای تکرارشوندهای که پرامپتها را در برابر سیستمهای واقعی آزمایش میکنند، میتوانند اقدامات واقعی را در صورت رسیدگی عامل به حسابهای مشتریان یا ابزارهای تولیدی، آغاز کنند.
نتیجه SpreadsheetBench-Verified، که در آن GEPA با اختلاف ۹.۴ امتیاز پیشتاز بود، نشان میدهد که یک بهینهساز تکرارشونده بازتابی همچنان میتواند در وظایف ساختاریافته خاصی پیروز شود. این روش همچنین به کیفیت گزارشهای ذخیرهشده بستگی دارد، بنابراین مجموعهای پر از اپیزودهای محدود یا غیرنماینده میتواند قوانینی تولید کند که قابل تعمیم نباشند.



