AgentSpec · استاندارد آمادگی production · v2026.09

در ۲ دقیقه Agent خودت را بسنج.
Production Readiness Score بگیر.

۳ ریسک اصلی معماری‌ات را پیدا کن، پاسپورت آمادگی بگیر و اگر خواستی بررسی انسانی بخواه. بدون ثبت‌نام، بدون قفل ایمیل.

خودارزیابی ← نمره ← ۳ ریسک ← پاسپورت ← بررسی انسانی

تعداد بررسی
35 سوال
سقف نمره
70
نسخه استاندارد
v2026.09
آخرین به‌روزرسانی
شهریور ۱۴۰۵

خودارزیابی معماری

به هر سوال صادقانه جواب بده: بله یعنی واقعاً داری، تا حدی یعنی نصفه، خیر یعنی نداری.

0 پاسخ داده شده از 35 · 0٪

آیا واقعاً Agent لازم است؟

1. آیا تسک با منطق قطعی (rule-based) قابل حل نیست و واقعاً به استدلال چندمرحله‌ای نیاز دارد؟

2. آیا سیستم به استفاده پویا از ابزارها (dynamic tool use) نیاز دارد؟

3. آیا خودمختاری (autonomy) ارزش قابل اندازه‌گیری نسبت به روش ساده‌تر دارد؟

انتخاب مدل

1. آیا از کوچک‌ترین مدلی که تسک را قابل اعتماد حل می‌کند استفاده می‌کنی؟

2. آیا latency، هزینه و سقف کانتکست مدل برای زبان/دامنه تو ارزیابی شده؟

3. آیا می‌توانی مدل را بعداً بدون بازنویسی کل سیستم عوض کنی؟

کانتکست / RAG / CAG

1. آیا منابع داده و استراتژی بازیابی (retrieval) مشخص و مستند است؟

2. آیا ranking / فیلترینگ روی نتایج بازیابی اعمال می‌شود؟

3. آیا در جاهای لازم citation / ارجاع به منبع وجود دارد؟

حافظه

1. آیا حافظه کوتاه‌مدت و بلندمدت از هم جدا و تعریف شده؟

2. آیا سیاست نگهداری و حذف حافظه کهنه (stale) وجود دارد؟

3. آیا حافظه حساس محافظت می‌شود (ماسک / دسترسی محدود)؟

ابزارها و Function Calling

1. آیا اسکیمای ابزارها explicit و ورودی‌ها validate می‌شوند؟

2. آیا خروجی ابزارها structured و قابل پارس است؟

3. آیا timeout / retry برای ابزارها تعریف شده؟

4. آیا ابزارهای مخرب (destructive) با permission کنترل می‌شوند؟

حلقه Agent

1. آیا شرط توقف (stop condition) و سقف تکرار (max iterations) تعریف شده؟

2. آیا تشخیص اقدام تکراری (duplicate action) وجود دارد؟

3. آیا Agent می‌تواند از خطای ابزار ریکاور شود؟

4. آیا Agent می‌تواند به انسان escalate کند؟

مهندسی Harness

1. آیا guardrailها بیرون از پرامپت (در harness) اجرا می‌شوند؟

2. آیا state به‌صورت صریح و durable مدیریت می‌شود؟

3. آیا فراخوانی ابزار قبل از اجرا validate می‌شود؟

4. آیا run ناموفق قابل بازتولید (reproducible) است؟

مسئولیت واحد

1. آیا مسئولیت Agent در یک جمله قابل توصیف است؟

2. آیا تعداد ابزارهای نامرتبط محدود است؟

3. آیا دسترسی‌ها از کل سیستم باریک‌تر (least-privilege) است؟

طراحی چندعامله

1. اگر چندعامله هستی: آیا پیچیدگی آن توجیه‌شده است؟ (اگر تک‌عامله‌ای: بله بزن)

2. آیا نقش هر Agent شفاف است؟ (تک‌عامله: بله)

3. آیا orchestrator / supervisor در جای لازم وجود دارد؟ (تک‌عامله: بله)

4. آیا عمق delegation کنترل‌شده و خروجی‌های متعارض حل می‌شوند؟ (تک‌عامله: بله)

امنیت / مشاهده‌پذیری / HITL

1. آیا جریان داده حساس شناخته‌شده و دسترسی‌ها least-privilege است؟

2. آیا trace / log / metric برای هر run وجود دارد؟

3. آیا اقدامات پرریسک تأیید انسانی (HITL) می‌خواهند؟

4. آیا rollback / recovery برای اثرهای Agent ممکن است؟