هوش مصنوعی

امنیت و آینده‌ی AI Agentها + ساخت یک Agent از صفر

اهورا سپنداراهورا سپندار۲۲ تیر ۱۴۰۵۱۲ دقیقه مطالعه
امنیت و آینده‌ی AI Agentها + ساخت یک Agent از صفر

لحظه‌ای که یک مدل زبانی از «حرف‌زدن» به «کنش‌کردن» می‌رسد، سطحِ حمله به‌طرزِ انفجاری بزرگ می‌شود. در این مقاله‌ی پایانیِ مجموعه، سه چیز را بررسی می‌کنیم: امنیتِ عامل‌ها (و «مثلث مرگبار»)، آینده‌ی این فناوری با نگاهی واقع‌بینانه به قابلیت‌اعتماد، و در نهایت یک معماری مرجع برای ساختِ یک Agent از صفر.

امنیت AI Agentها

اینجا جدی‌ترین بخشِ مقاله است. لحظه‌ای که یک LLM از «حرف‌زدن» به «کنش‌کردن» می‌رسد، سطحِ حمله به‌طرزِ انفجاری بزرگ می‌شود. در دسامبر ۲۰۲۵، OWASP اولین «Top 10 برای اپلیکیشن‌های عامل‌گونه» را منتشر کرد — نخستین چارچوبِ داوری‌شده که مخصوصِ امنیتِ عامل‌های خودمختار است (با مشارکتِ ۱۰۰+ متخصص و تأییدِ NIST، مایکروسافت و NVIDIA).

تهدیدها

تهدیدچگونه کار می‌کند
تزریق پرامپت (Prompt Injection)مهاجم دستوراتِ مخرب را در متنی که Agent می‌خواند پنهان می‌کند. مستقیم (در ورودی) یا غیرمستقیم (در یک صفحه‌ی وب، ایمیل یا سندی که Agent بازیابی می‌کند). Simon Willison — که خودِ اصطلاح را ساخت — آن را به تزریقِ SQL تشبیه می‌کند: مخلوط‌شدنِ محتوای معتمد و نامعتمد در یک زمینه.
سوءاستفاده از ابزار (Tool Abuse)مهاجم Agent را فریب می‌دهد تا ابزارهای مجازش را برای کارِ ناخواسته به کار برد — یک دستورِ مخرب می‌تواند فایل حذف کند، ایمیلِ غیرمجاز بفرستد یا خسارتِ مالی بزند. (T2 در OWASP.)
مسموم‌سازیِ حافظه (Memory Poisoning)مهاجم داده‌ی مخرب را در حافظه‌ی بلندمدت/RAG تزریق می‌کند. برخلافِ تزریقِ پرامپت، این ماندگار است — Agent مدت‌ها پس از حمله همچنان نادرست رفتار می‌کند. (T1 در OWASP.)
مسموم‌سازیِ مهارت/پلاگین (Supply Chain)یک مهارت یا پلاگینِ آلوده از رجیستری نصب می‌شود و کدِ مخرب یا دستورالعملِ بد را وارد می‌کند.
نشتِ اعتبارنامه (Credential Leakage)Agent به کلیدها و توکن‌ها دسترسی دارد؛ با یک تزریقِ موفق می‌تواند آن‌ها را به بیرون بفرستد.
خسارتِ خودمختار (Autonomous Damage)Agent با «عاملیتِ بیش‌ازحد» کنشِ مخرب و برگشت‌ناپذیر انجام می‌دهد (حذفِ داده، تراکنشِ مالی).
دسترسیِ بیش‌ازحد (Over-Privilege)به Agent مجوزهای بیشتر از نیاز داده می‌شود؛ یک خطای کوچک به فاجعه تبدیل می‌شود.

«مثلث مرگبار» (The Lethal Trifecta)

مفهومی که Simon Willison در ژوئن ۲۰۲۵ مطرح کرد و به مهم‌ترین قاعده‌ی امنیتیِ عامل‌ها تبدیل شد. اگر یک Agent هم‌زمان این سه ویژگی را داشته باشد، در معرضِ سرقتِ داده است:

  1. دسترسی به داده‌ی خصوصیِ شما،
  2. مواجهه با محتوای نامعتمد (هر متنی که مهاجم می‌تواند کنترلش کند)،
  3. توانِ ارتباطِ بیرونی (هر راهی برای فرستادنِ داده به بیرون).

اگر هر سه با هم باشند، مهاجم می‌تواند Agent را فریب دهد تا داده‌ی خصوصی را بخواند و برای او بفرستد. Willison هشدار می‌دهد که مشکلِ MCP دقیقاً همین است: کاربران را تشویق می‌کند ابزارها را از منابعِ مختلف قاطیِ هم کنند — و کافی است یکی داده‌ی خصوصی بدهد و دیگری یک درخواستِ HTTP بزند تا مثلث کامل شود.

راهکارها

راهکارچه می‌کند
جعبه‌ی شنی و ایزولاسیون (Sandbox)اجرای کنش‌ها در محیطِ محصور (کانتینر) تا خسارت مهار شود
تأییدِ انسانی (Human-in-the-loop)کنش‌های حساس (ارسال ایمیل، حذف، پرداخت) پیش از اجرا منتظرِ تأییدِ شما بمانند
کمترین دسترسی (Least Privilege)به هر Agent فقط دقیقاً مجوزهای لازم را بدهید، نه بیشتر
لاگِ ممیزی (Audit Log)ثبتِ هر کنش برای ردیابی و بازبینیِ پس از حادثه
محدودسازیِ قابلیت«شکستنِ مثلث»: اگر Agent داده‌ی خصوصی می‌بیند، اجازه‌ی ارتباطِ بیرونیِ آزاد ندهید
فیلترِ ورودی/خروجی و Guardrailپالایشِ محتوای نامعتمد و بازبینیِ خروجی پیش از کنش
قاعده‌ی طلایی: هیچ‌وقت هر سه ضلعِ مثلثِ مرگبار را به یک Agent با هم ندهید. اگر مجبورید، حداقل ضلعِ «ارتباطِ بیرونی» را با تأییدِ انسانی مهار کنید.

آینده‌ی AI Agentها

در ۱ تا ۳ سالِ آینده، عامل‌ها کجا می‌روند؟ چند مسیرِ محتمل:

  • عاملِ شخصی (Personal AI Agent): دقیقاً چیزی که OpenClaw و Hermes پیش‌درآمدش هستند — یک دستیارِ همیشه‌روشن که ایمیل، تقویم، فایل و اپ‌های شما را می‌شناسد و کارها را پیش می‌برد.
  • «کارمندِ هوش مصنوعی» (AI Employee): عامل‌هایی که نقشِ یک همکارِ تمام‌وقت را در گردش‌کارهای سازمانی بازی می‌کنند.
  • توسعه‌دهنده‌ی خودمختار: در مسیرِ Devin — عاملی که یک تیکت را می‌گیرد و PR تحویل می‌دهد.
  • دستیارِ پژوهش: عامل‌هایی که ساعت‌ها منابع را می‌خوانند، تحلیل می‌کنند و گزارش می‌سازند.
  • «سیستم‌عاملِ هوش مصنوعی» (AI OS): ایده‌ای که در آن Agent لایه‌ی اصلیِ تعامل با کامپیوتر می‌شود، نه اپ‌ها.

⚠️ وزنه‌ی تعادل: مسئله‌ی قابلیت‌اعتماد

اما باید هیجان را با واقعیت متعادل کرد. مهم‌ترین داده‌ی ضدِهایپ از METR می‌آید که «افقِ زمانیِ» عامل‌ها را می‌سنجد — یعنی طولِ کاری که یک عامل با نرخِ موفقیتِ مشخص می‌تواند تمام کند:

  • METR تخمین زده افقِ زمانیِ عامل‌ها روی کارهای نرم‌افزاری تقریباً هر ۷ ماه دو برابر می‌شود (و در ۲۰۲۴-۲۰۲۵ حتی هر ۴ ماه). اگر این روند ادامه یابد، عامل‌ها شاید حدود ۲۰۲۷ به کارهای یک‌ماهه برسند.
  • اما نکته‌ی حیاتی: نرخِ موفقیت با طولِ کار افت می‌کند. عامل‌ها در کارهای کوتاه عالی‌اند، اما هرچه کار طولانی‌تر و چندمرحله‌ای‌تر شود، احتمالِ شکست بالا می‌رود — به‌خاطرِ همان انباشتِ خطا که Anthropic هم هشدارش را داد. یک خطای کوچک در گام دهم، کلِ کار را خراب می‌کند.

پس تصویرِ واقع‌بینانه این است: عامل‌ها با سرعتی چشمگیر بهتر می‌شوند، اما «قابلیت‌اعتماد در افق‌های بلند» هنوز مرزِ حل‌نشده‌ی این حوزه است. آینده‌ای که در آن یک Agent بدونِ نظارت یک پروژه‌ی چندروزه را بی‌نقص پیش ببرد، هنوز نیامده — و شاید بزرگ‌ترین چالشِ فنیِ سه سالِ آینده همین باشد.

ساخت یک Agent از صفر

معماری مرجع برای ساخت یک عامل از صفر: کنترلر عامل، LLM، رجیستری ابزار، پایگاه‌داده حافظه و برداری، زمان‌بند و لایه امنیت
معماری مرجع؛ اجزای حداقلیِ یک عامل واقعی

حالا همه‌ی تکه‌ها را کنار هم می‌گذاریم. یک معماریِ مرجع برای ساختِ یک Agent شاملِ این اجزاست:

مؤلفهمسئولیت
LLMمغز؛ استدلال و تصمیمِ گامِ بعد. ترجیحاً مدل‌ناوابسته (پشتِ یک واسط)
Agent Controllerخودِ حلقه: مشاهده، برنامه‌ریزی، فراخوانی ابزار، ارزیابی، تکرار تا هدف
Memory Databaseحالتِ نشست‌ها و حقایقِ ماندگار (مثلاً SQLite)
Vector Databaseبازیابیِ معناییِ حافظه‌ی بلندمدت (امبدینگ + جست‌وجوی شباهت)
Tool Registryفهرستِ ابزارها با شِمای‌شان؛ نقطه‌ی وصلِ MCP
Schedulerاجرای زمان‌بندی‌شده/پیش‌دستانه (مثلِ heartbeatِ OpenClaw)
Security Layersandbox، کمترین‌دسترسی، تأییدِ انسانی، لاگِ ممیزی — لایه‌ای که همه‌چیز را دربرمی‌گیرد

معادلِ Mermaid برای بازسازیِ این معماری:

graph TD
    User[User / Channel] --> Ctrl[Agent Controller]
    Ctrl <--> LLM[LLM: the brain]
    Ctrl --> TR[Tool Registry]
    TR --> MCP[[MCP servers]]
    Ctrl <--> MemDB[(Memory DB: sessions, facts)]
    Ctrl <--> VecDB[(Vector DB: semantic recall)]
    Sched[Scheduler / Heartbeat] --> Ctrl
    subgraph SEC[Security Layer]
      Ctrl
      TR
    end
    SEC -. sandbox, least-privilege, approval, audit .-> Ctrl

حداقلی‌ترین حلقه‌ی کنترلر، در شبه‌کد:

state = load_memory(user)                 # حافظه‌ی بلندمدت
messages = build_prompt(goal, state)
for step in range(MAX_STEPS):             # بودجه‌ی تکرار (مثلاً 90)
    reply = llm(messages, tools=registry) # مدل: فکر یا فراخوانیِ ابزار
    if reply.tool_calls:
        for call in reply.tool_calls:
            check_permission(call)         # لایه‌ی امنیت
            result = runtime.execute(call)  # اجرای واقعی در sandbox
            audit_log(call, result)
            messages.append(result)
    else:
        save_memory(user, reply)           # یادگیری/ماندگاری
        return reply                        # هدف محقق شد

همین اسکلتِ ساده، هسته‌ی مشترکِ OpenClaw، Hermes و تقریباً هر Agent دیگری است؛ تفاوتِ محصولات در این است که هر کدام کدام قطعه را قوی‌تر کرده‌اند (OpenClaw کانال‌ها و heartbeat را، Hermes حلقه‌ی مهارت و حافظه را).

سوالات متداول

بزرگ‌ترین خطر امنیتی AI Agentها چیست؟
تزریق پرامپت (Prompt Injection) — به‌خصوص نوعِ غیرمستقیم که در محتوای بازیابی‌شده پنهان می‌شود — و «مثلث مرگبار» که ترکیبِ دسترسی به داده‌ی خصوصی، محتوای نامعتمد و ارتباطِ بیرونی است.

«مثلث مرگبار» چیست؟
مفهومی از Simon Willison: اگر یک Agent هم‌زمان به داده‌ی خصوصی دسترسی داشته باشد، با محتوای نامعتمد مواجه شود و بتواند با بیرون ارتباط بگیرد، در معرضِ سرقتِ داده است.

آینده‌ی AI Agentها چگونه است؟
عامل‌ها با سرعتِ چشمگیری بهتر می‌شوند (طبق METR، افقِ زمانی‌شان تقریباً هر ۷ ماه دو برابر می‌شود)، اما قابلیت‌اعتماد در کارهای طولانی هنوز مرزِ حل‌نشده است؛ نرخِ موفقیت با طولِ کار افت می‌کند.

جمع‌بندی

عامل‌های هوش مصنوعی هیجان‌انگیزند، اما بهترین سازندگانِ آن‌ها کسانی‌اند که هم‌زمان که این قدرت را می‌سازند، محدودیت‌ها و خطراتش را هم صادقانه می‌بینند. برای تصویرِ کاملِ این حوزه، مقاله‌ی مرجعِ جامع را ببینید.

این مقاله بخشی از مجموعه‌ی «AI Agents در ۲۰۲۶» است؛ برای فهرستِ منابعِ علمیِ کامل به مقاله‌ی مرجع مراجعه کنید.

برچسب‌ها:AI AgentامنیتPrompt Injectionآینده هوش مصنوعیمعماری
اهورا سپندار
نویسنده
اهورا سپندار
نویسنده‌ی حوزه‌ی فناوری و هوش مصنوعی

اهورا درباره‌ی فناوری‌های نوین، هوش مصنوعی و تأثیر آن‌ها بر کسب‌وکارهای آنلاین می‌نویسد. هدف او ساده‌کردن مفاهیم پیچیده است تا خوانندگان بدون پیش‌زمینه‌ی فنی هم بتوانند از این فناوری‌ها بهره ببرند.

مقاله‌های بیشتر از اهورا سپندار ←

مقاله‌های مرتبط

به کمک نیاز دارید؟

تیم پشتیبانی ما ۲۴ ساعته آماده پاسخگویی به سوالات شما و ارائه راهنمایی‌های تخصصی است.

کمک فروش هاستینو

۲۴/۷/۳۶۵ از طریق ویجت چت

گفتگو کنید

چت پشتیبانی مشتریان

۲۴/۷/۳۶۵ از طریق پنل

برو به پنل

ایمیل پشتیبانی مشتریان

۲۴/۷/۳۶۵ از طریق پنل

برو به پنل

پشتیبانی با هوش مصنوعی

۲۴/۷/۳۶۵ کمک فوری هوش مصنوعی

امتحان دستیار هوشمند

ما باور داشتیم دنیای هاستینگ نیاز به یک تحول بزرگ دارد — و افتخار می‌کنیم آغازگر این تغییر بوده‌ایم.