حافظه و ابزار در AI Agentها؛ راهنمای فنی (+ MCP)

اگر بخواهیم یک تفاوت را بهعنوان مهمترین تفاوتِ یک Agent با یک چتبات انتخاب کنیم، آن حافظه است. و اگر بخواهیم بدانیم چطور یک Agent واقعاً «کار» میکند، باید ابزار و اجرای کنش را بفهمیم. در این مقالهی فنی، هر دو را عمیق بررسی میکنیم — بههمراه MCP، پروتکلی که به استانداردِ اتصالِ ابزارها تبدیل شده است.
📚 این مقاله بخشی از مجموعهی «AI Agents در ۲۰۲۶» است
حافظه (Memory) در AI Agentها

اگر بخواهیم یک تفاوت را بهعنوان مهمترین تفاوتِ Agent و چتبات انتخاب کنیم، آن حافظه است. چون API مدل بیحالت است، یک چتبات هر درخواست را یک تراکنشِ منزوی میبیند. یک Agentِ دارای حالت اما پیش از ساختنِ پرامپت، حالتِ پیشین را از یک ذخیرهساز بیرونی میخواند و پس از پاسخ، حالتِ بهروز را برمیگرداند.
جملهای که این را خوب خلاصه میکند: پنجرهی متن، Agent را درونِ یک نشست منسجم نگه میدارد؛ اما حافظه است که آن را بین نشستها هوشمند میکند.
انواع حافظه
| نوع | چیست | کجا ذخیره میشود |
|---|---|---|
| Working (کاری) | متغیرهای زندهی همین چرخهی تصمیم — دفترچهی یادداشتِ لحظهای | پنجرهی متن |
| Short-Term (کوتاهمدت) | تاریخچهی گفتوگوی همین نشست؛ «یادگیری درونمتنی» | پنجرهی متن (محدود و متناهی) |
| Long-Term (بلندمدت) | هر چیزی که باید بعد از بستهشدنِ نشست بماند | پایگاهدادهی بیرونی |
| Vector (برداری) | امبدینگها + جستوجوی شباهت؛ پایهی RAG | پایگاهدادهی برداری (FAISS، HNSW و...) |
| Episodic (رویدادی) | تجربهها و مسیرهای اجرایِ گذشته («دفعهی قبل چه کردم و چه شد») | ذخیرهساز بیرونی |
| Semantic (معنایی) | دانش دربارهی جهان و دربارهی خودِ کاربر («این کاربر مدیر مالی است») | ذخیرهساز بیرونی |
| Procedural (رویهای) | «چگونه انجام دادن» — مهارتها و رویههای آموختهشده | وزنهای مدل + کد/فایلهای مهارت |
معماریهای مرجعِ حافظه
- RAG (Lewis و همکاران، ۲۰۲۰): ترکیبِ حافظهی پارامتری (وزنهای مدل) با حافظهی غیرپارامتری (یک ایندکسِ برداریِ متراکم که با یک بازیاب عصبی خوانده میشود). این همان مکانیزمی است که زیرِ «حافظهی برداری» نشسته است.
- MemGPT / Letta (Packer و همکاران، ۲۰۲۳): مدیریتِ متنِ مجازی بهقیاسِ حافظهی سلسلهمراتبیِ سیستمعامل. یک main context (پنجرهی متن = «RAM») و یک external context (بایگانی = «دیسک»). نکتهی درخشان: خودِ LLM با فراخوانیِ توابعِ خودش اطلاعات را بین این دو صفحهبندی (page in/out) میکند — حتی میتواند پرامپتِ سیستمیِ خودش را ویرایش کند.
- Generative Agents (Park و همکاران، ۲۰۲۳): یک «جریانِ حافظه» به زبان طبیعی، با امتیازِ بازیابی = تازگی + اهمیت + ارتباط. تازگی با افتِ نمایی (γ = ۰.۹۹۵)، اهمیت با یک امتیازِ ۱ تا ۱۰ که خودِ LLM میدهد، و ارتباط با شباهتِ کسینوسیِ امبدینگ. مکانیزمِ Reflection هم بهصورت دورهای خاطراتِ سطحِ پایین را به انتزاعهای سطحِ بالاتر تبدیل میکند.
- A-MEM (Xu و همکاران، ۲۰۲۵): حافظهی عاملگونه به سبکِ Zettelkasten؛ هر خاطره یک یادداشتِ ساختاریافته (توضیح، کلیدواژه، برچسب) میشود، سیستم خودش یادداشتهای مرتبط را به هم لینک میکند، و — نکتهی متمایز — افزودنِ یک خاطرهی جدید میتواند خاطراتِ قدیمی را هم بهروز کند (تکاملِ پویا)، نه اینکه فقط درج شود.
⚠️ حافظه هنوز حلنشده است. این رویکردها واگرا هستند (صفحهبندی به سبکِ OS در MemGPT، امتیازدهیِ وزندار در Generative Agents، گرافِ دانشِ تکاملیابنده در A-MEM) و هیچ استانداردِ غالبی وجود ندارد — نشانهی روشنی از اینکه این حوزه هنوز در حال تثبیت است.
استفاده از ابزار و اجرای کنش
اینجا مهمترین سوءتفاهمِ فنیِ حوزهی Agent را باید رفع کنیم.
تفاوت بنیادی: تولیدِ متن در برابر اجرای کنش
LLM هیچوقت چیزی را اجرا نمیکند. کاری که میکند این است که یک فراخوانیِ ساختاریافته (معمولاً یک آبجکت JSON با نام تابع و آرگومانها) تولید میکند — و این خودش «تولید متن» است. سپس یک رانتایمِ بیرونی آن فراخوانی را میگیرد، واقعاً اجرا میکند (تابع را صدا میزند، به API میزند، کوئری میگیرد، کد را اجرا میکند) و نتیجه را به متنِ مدل برمیگرداند.
هر دو غولِ اصلی این را صریح گفتهاند:
- OpenAI (Function Calling، ژوئن ۲۰۲۳): توسعهدهنده توابع را توصیف میکند؛ مدل «هوشمندانه انتخاب میکند که یک آبجکت JSON حاوی آرگومانها خروجی دهد» — اما اجرا نمیکند؛ کدِ توسعهدهنده اجرا و نتیجه را برمیگرداند.
- Anthropic (Tool Use): Claude «یک فراخوانیِ ساختاریافته برمیگرداند که اپلیکیشنِ شما اجرا میکند». جریان: مدل
stop_reason: "tool_use"میدهد ← کدِ شما اجرا میکند ← یکtool_resultبرمیگردانید ← مدل پاسخ نهایی را میدهد.
پس دقیقتر است بگوییم: مدل «قصدِ کنش» تولید میکند؛ Agent (رانتایم) آن قصد را به کنشِ واقعی تبدیل میکند. این جداییِ ظریف، هم کلیدِ فهمِ معماری است و هم — همانطور که در بخش امنیت میبینیم — کلیدِ فهمِ خطرات.
Agent چگونه کنشهای واقعی انجام میدهد؟
| کنش | مکانیزم | مثال ابزار |
|---|---|---|
| باز کردن مرورگر | ابزارِ اتوماسیونِ مرورگر (Playwright/Puppeteer) یا «استفاده از کامپیوتر» | browser.navigate(url)، computer (Anthropic) |
| فراخوانی API | یک تابع که درخواستِ HTTP میزند | http.get(endpoint, params) |
| کوئریِ پایگاهداده | ابزاری که SQL را روی اتصالِ محدودشده اجرا میکند | db.query(sql) |
| ساخت/ویرایش فایل | ابزارِ سیستمِ فایل | text_editor، write_file() |
| اجرای کد | مفسر در یک محیطِ ایزوله (sandbox) | code_execution، python(code) |
| تعامل با سیستمعامل | ابزارِ شل با مجوزهای محدود | bash(command) |
ریشههای پژوهشی
- Toolformer (Schick و همکاران، Meta AI، ۲۰۲۳): مدل بهصورت خودنظارتی به خودش ابزار یاد میدهد. نمونهفراخوانیهای API تولید میکند، اجرا میکند، و فقط آنهایی را نگه میدارد که نتیجهشان سرگشتگی (perplexity) مدل را روی متنِ اطراف کاهش میدهد، سپس روی همان دادهی فیلترشده فاینتیون میشود. یاد میگیرد کدام API، کِی، با چه آرگومانی، و چگونه از نتیجه استفاده کند.
- ReAct: همان حلقهی Thought→Action→Observation که زیربنای همهی فریمورکهای ابزارمحورِ امروزی است.
یک بهینهسازیِ جالبِ ۲۰۲۵-۲۰۲۶: فراخوانیِ برنامهنویسیشدهی ابزار (Programmatic Tool Calling) — بهجای اینکه هر فراخوانی یک رفتوبرگشت با مدل باشد، مدل کدی مینویسد که ابزارها را درونِ یک محیطِ اجرای کد صدا میزند. Anthropic گزارش کرده این کار روی یک بنچمارکِ داخلیِ ۷۵ ابزاره، حدود ۳۸٪ توکنِ ورودیِ کمتر بدون افتِ دقت مصرف میکند.
سوالات متداول
چرا حافظه مهمترین تفاوت Agent با چتبات است؟
چون API مدل بیحالت است؛ پنجرهی متن Agent را درونِ یک نشست منسجم نگه میدارد، اما حافظه است که آن را بین نشستها هوشمند میکند.
انواع حافظه در Agent کداماند؟
کاری، کوتاهمدت (پنجرهی متن)، بلندمدت، برداری (RAG)، رویدادی، معنایی و رویهای (مهارتها).
تفاوت تولید متن و اجرای کنش چیست؟
مدل فقط یک فراخوانیِ ساختاریافته (JSON) تولید میکند؛ یک رانتایمِ بیرونی آن را واقعاً اجرا میکند و نتیجه را برمیگرداند. مدل هیچوقت خودش چیزی اجرا نمیکند.
MCP چیست؟
Model Context Protocol، یک استانداردِ بازِ Anthropic (نوامبر ۲۰۲۴) که اتصالِ ابزارها و دادهها به عاملها را یکپارچه میکند — «پورت USB-C برای اپلیکیشنهای هوش مصنوعی».
جمعبندی
حافظه به Agent ماندگاری میدهد و ابزار به آن توانِ کنش؛ MCP هم اتصالِ این ابزارها را استاندارد کرده است. در مقالات بعدی، میبینیم که چطور پروژههای واقعی مثل OpenClaw و Hermes این ایدهها را پیاده کردهاند.
این مقاله بخشی از مجموعهی «AI Agents در ۲۰۲۶» است؛ برای فهرستِ منابعِ علمیِ کامل به مقالهی مرجع مراجعه کنید.

اهورا دربارهی فناوریهای نوین، هوش مصنوعی و تأثیر آنها بر کسبوکارهای آنلاین مینویسد. هدف او سادهکردن مفاهیم پیچیده است تا خوانندگان بدون پیشزمینهی فنی هم بتوانند از این فناوریها بهره ببرند.
مقالههای بیشتر از اهورا سپندار ←

