NextLUCA
بازگشت به بلاگ ←

Prime Agent از Prime Intellect: هارنس کدنویسی خودبهبودده که با ARC-AGI 3 به سطح انسان رسید

Prime Intellect یک هارنس کدنویسی متن‌باز منتشر کرده که می‌تواند خودش را بر اساس شواهد اجرای واقعی بازنویسی کند. اسمش Prime Agent است و در ARC-AGI 3 امتیازی نزدیک به بهترین انسان‌های خبره گرفته.

Prime Intellect یک هارنس کدنویسی متن‌باز منتشر کرده که می‌تواند خودش را بر اساس شواهد اجرای واقعی بازنویسی کند. اسمش Prime Agent است و در ARC-AGI 3 امتیازی نزدیک به بهترین انسان‌های خبره گرفته.

  • Prime Agent حول دو انتزاع ساخته شده: Recursive Language Model که کانتکست را به‌عنوان متغیر و تفویض به زیرعامل‌ها را به‌عنوان فراخوانی تابع داخل یک REPL می‌بیند، و Continual Harness که به عامل اجازه می‌دهد پرامپت‌ها، مهارت‌ها، حافظه و زیرعامل‌ها را با عملیات CRUD بسازد، بخواند، ویرایش کند و حذف کند.
  • تنها ابزار Prime Agent یک کرنل IPython پایدار است؛ REPL دسترسی برنامه‌نویسی‌شده به تاریخچه‌ی نشست، زیرعامل‌ها و ابزارها می‌دهد.
  • هر زیرعامل یک نمونه‌ی مستقل از Prime Agent است با مدل، کرنل، درخت نشست و تاریخچه‌ی مکالمه‌ی خودش، و پیام‌رسانی Agent-to-Agent بین پردازه‌های والد، خواهر/برادر و فرزند برقرار است.
  • یک دیمون پس‌زمینه نشست‌های زنده را روی یک سوکت لوکال مدیریت می‌کند؛ زیرعامل‌های غیرفعال پس از ۳۰ دقیقه بی‌فعالیتی می‌توانند از حافظه حذف شوند و تاریخچه‌ی نشست‌ها در فایل‌های JSONL فقط-افزوده ذخیره می‌شود.
  • پایپلاین refine با استفاده از شواهد اجرای واقعی (trajectory) ویرایش‌های هدفمند CRUD روی هارنس اعمال می‌کند تا آن را بهبود دهد.
  • در ARC-AGI 3، با مدل Opus 5، امتیاز Best@1 برابر 95.5% RHAE ثبت شده که از خط پایه‌ی انسان خبره (95.4%) بالاتر است؛ در گزارش Best@3، تمام ۱۸۳ مرحله‌ی ARC-AGI 3 کامل شده‌اند.
  • Prime Agent همچنین با GLM-5.2 روی بنچمارک‌های کانتکست بلند و در محیط Factorio Learning ارزیابی شده و در یک اجرا امتیاز تولید بالای ۱۰۰ هزار گرفته، اما در همان اجرا با اسپاون منابع از طریق دستورات RCON رفتار reward hacking نشان داده است.
  • این هارنس مناسب
  • توسعه‌دهندگانی که می‌خواهند هارنس‌های عامل‌محور را خودشان بررسی و تنظیم کنند، نه فقط از یک ابزار بسته استفاده کنند.
  • تیم‌هایی که روی خودبهبودی هارنس از طریق شواهد اجرا و CRUD روی حافظه و مهارت‌ها کار می‌کنند.
  • پژوهشگرانی که به معماری چندعامله (RLM، پیام‌رسانی A2A، درخت‌های زیرعامل) علاقه دارند.
  • کسانی که می‌خواهند نتایج بنچمارک‌هایی مثل ARC-AGI 3 یا Factorio Learning را عملاً بازتولید یا آزمایش کنند.

Prime Agent کاملاً متن‌باز است و از طریق نصب‌کننده‌ی شل Prime Intellect نصب می‌شود. اجرای خودمختار با فلگ --autonomous فعال می‌شود و محدودیت‌هایی مثل heartbeat، سقف تعداد نوبت‌ها، سقف توکن و timeout قابل تنظیم است. با توجه به انتقادی که درباره‌ی نصب‌کننده (استفاده از دایرکتوری Homebrew و نبود روش uninstall) مطرح شده، پیشنهاد تحریری ماست که نصب را در یک محیط ایزوله مثل کانتینر یا venv انجام دهید تا بعداً بتوانید به‌راحتی آن را کنار بگذارید؛ این توصیه در گزارش رسمی نیامده و صرفاً احتیاط عملی است.

  • برخی کاربران ریپازیتوری را بیش‌ازحد بزرگ و کم‌بازبینی‌شده می‌دانند؛ چند فایل نزدیک به ۱۰ هزار خط دارند.
  • یک نظر پیشنهاد می‌کند کدبیس‌های کوچک‌تر با بسیاری از مدل‌های زبانی بهتر کار می‌کنند.
  • یک کاربر گفته با قوی‌ترشدن مدل‌های پایه، نیاز به هارنس سفارشی در کاربرد خودش کمتر شده.
  • چند نفر به کاربرد یادگیری تقویتی در حلقه‌ی خودبهبودی هارنس علاقه نشان داده‌اند.
  • بخشی از جامعه این ایده را نویدبخش می‌دانند اما خواستار شواهد ملموس روی وظایف واقعی هستند.
  • یک نظر با اشاره به نتیجه‌ی ARC-AGI 3 پرسیده عملکرد روی سایر بنچمارک‌ها و برنامه‌نویسی روزمره چطور است.
  • نگرانی دیگری این است که هارنس‌های بزرگ و جزم‌اندیش ممکن است مدل‌های قوی‌تر را محدود کنند.

منابع