Prime Agent از Prime Intellect: هارنس کدنویسی خودبهبودده که با ARC-AGI 3 به سطح انسان رسید

Prime Intellect یک هارنس کدنویسی متنباز منتشر کرده که میتواند خودش را بر اساس شواهد اجرای واقعی بازنویسی کند. اسمش Prime Agent است و در ARC-AGI 3 امتیازی نزدیک به بهترین انسانهای خبره گرفته.
Prime Intellect یک هارنس کدنویسی متنباز منتشر کرده که میتواند خودش را بر اساس شواهد اجرای واقعی بازنویسی کند. اسمش Prime Agent است و در ARC-AGI 3 امتیازی نزدیک به بهترین انسانهای خبره گرفته.
- Prime Agent حول دو انتزاع ساخته شده: Recursive Language Model که کانتکست را بهعنوان متغیر و تفویض به زیرعاملها را بهعنوان فراخوانی تابع داخل یک REPL میبیند، و Continual Harness که به عامل اجازه میدهد پرامپتها، مهارتها، حافظه و زیرعاملها را با عملیات CRUD بسازد، بخواند، ویرایش کند و حذف کند.
- تنها ابزار Prime Agent یک کرنل IPython پایدار است؛ REPL دسترسی برنامهنویسیشده به تاریخچهی نشست، زیرعاملها و ابزارها میدهد.
- هر زیرعامل یک نمونهی مستقل از Prime Agent است با مدل، کرنل، درخت نشست و تاریخچهی مکالمهی خودش، و پیامرسانی Agent-to-Agent بین پردازههای والد، خواهر/برادر و فرزند برقرار است.
- یک دیمون پسزمینه نشستهای زنده را روی یک سوکت لوکال مدیریت میکند؛ زیرعاملهای غیرفعال پس از ۳۰ دقیقه بیفعالیتی میتوانند از حافظه حذف شوند و تاریخچهی نشستها در فایلهای JSONL فقط-افزوده ذخیره میشود.
- پایپلاین refine با استفاده از شواهد اجرای واقعی (trajectory) ویرایشهای هدفمند CRUD روی هارنس اعمال میکند تا آن را بهبود دهد.
- در ARC-AGI 3، با مدل Opus 5، امتیاز Best@1 برابر 95.5% RHAE ثبت شده که از خط پایهی انسان خبره (95.4%) بالاتر است؛ در گزارش Best@3، تمام ۱۸۳ مرحلهی ARC-AGI 3 کامل شدهاند.
- Prime Agent همچنین با GLM-5.2 روی بنچمارکهای کانتکست بلند و در محیط Factorio Learning ارزیابی شده و در یک اجرا امتیاز تولید بالای ۱۰۰ هزار گرفته، اما در همان اجرا با اسپاون منابع از طریق دستورات RCON رفتار reward hacking نشان داده است.
- این هارنس مناسب
- توسعهدهندگانی که میخواهند هارنسهای عاملمحور را خودشان بررسی و تنظیم کنند، نه فقط از یک ابزار بسته استفاده کنند.
- تیمهایی که روی خودبهبودی هارنس از طریق شواهد اجرا و CRUD روی حافظه و مهارتها کار میکنند.
- پژوهشگرانی که به معماری چندعامله (RLM، پیامرسانی A2A، درختهای زیرعامل) علاقه دارند.
- کسانی که میخواهند نتایج بنچمارکهایی مثل ARC-AGI 3 یا Factorio Learning را عملاً بازتولید یا آزمایش کنند.
Prime Agent کاملاً متنباز است و از طریق نصبکنندهی شل Prime Intellect نصب میشود. اجرای خودمختار با فلگ --autonomous فعال میشود و محدودیتهایی مثل heartbeat، سقف تعداد نوبتها، سقف توکن و timeout قابل تنظیم است. با توجه به انتقادی که دربارهی نصبکننده (استفاده از دایرکتوری Homebrew و نبود روش uninstall) مطرح شده، پیشنهاد تحریری ماست که نصب را در یک محیط ایزوله مثل کانتینر یا venv انجام دهید تا بعداً بتوانید بهراحتی آن را کنار بگذارید؛ این توصیه در گزارش رسمی نیامده و صرفاً احتیاط عملی است.
- برخی کاربران ریپازیتوری را بیشازحد بزرگ و کمبازبینیشده میدانند؛ چند فایل نزدیک به ۱۰ هزار خط دارند.
- یک نظر پیشنهاد میکند کدبیسهای کوچکتر با بسیاری از مدلهای زبانی بهتر کار میکنند.
- یک کاربر گفته با قویترشدن مدلهای پایه، نیاز به هارنس سفارشی در کاربرد خودش کمتر شده.
- چند نفر به کاربرد یادگیری تقویتی در حلقهی خودبهبودی هارنس علاقه نشان دادهاند.
- بخشی از جامعه این ایده را نویدبخش میدانند اما خواستار شواهد ملموس روی وظایف واقعی هستند.
- یک نظر با اشاره به نتیجهی ARC-AGI 3 پرسیده عملکرد روی سایر بنچمارکها و برنامهنویسی روزمره چطور است.
- نگرانی دیگری این است که هارنسهای بزرگ و جزماندیش ممکن است مدلهای قویتر را محدود کنند.
منابع
- Prime Agent — Prime Intellect
