卡帕西中文站 / 推文解读 / LLM OS 架构图

一张手绘图定义 agent 架构:LLM OS 图解读

原推发布:2023-11-11 · 解读更新:2026-08 · 阅读约 4 分钟

一句话

在提出「LLM 是新操作系统的内核」六周后,卡帕西把这个类比画成了一张图。这张随手画的架构图后来成了agent 架构文章中被引用最多的示意图——2024 年之后几乎每一篇讲 AI agent 系统设计的文章,都能看到它或它的变体。

他说了什么

推文正文只有一句自嘲式的预告:

"LLM OS. Bear with me I'm still cooking." —— @karpathy,2023-11-11 · 查看原推 →

真正的内容在配图里(版权归作者,这里以文字描述):图的中心是 LLM,位置相当于一台计算机的 CPU;紧挨着它的是上下文窗口,标注为 RAM——模型的工作内存。四周环绕着一圈「外设」:文件系统(磁盘,含向量嵌入检索,对应今天的 RAG);经典软件工具(计算器、Python 解释器、终端——即 Software 1.0 工具);浏览器(通往互联网);音视频输入输出(多模态外设);以及与其他 LLM 的通信(多智能体协作)。一句话概括这张图:把一台以语言模型为中枢处理器的「新计算机」的完整体系结构,画在了一张草图上。

背景:DevDay 之后、封神演讲之前

2023 年 11 月上旬正是关键窗口:OpenAI 刚开完首届 DevDay(11 月 6 日),发布了 GPTs 和 Assistants API——「带工具、带记忆的模型」第一次成为平台级产品。行业急需一个框架来理解这些拼图如何组成整体。十天后(11 月 22 日),卡帕西发布了那个观看量以百万计的《大语言模型入门》一小时演讲,结尾正是围绕这张图展开。所以这条推是一次「预告片」:图先出,讲解随后——「还在烹饪中」说的既是这张图,也是整个行业。

它引发了什么

对你意味着什么

  1. 把这张图当成 agent 项目的检查清单:设计一个 agent 时逐项自问——工作内存怎么管?长期记忆存哪、怎么检索?给它哪些工具、权限边界在哪?要不要联网?要不要和其他 agent 分工?六个方框问完,架构草图就有了。
  2. 每个「外设」都是一个创业切口:巨头做中枢(模型),生态位在外围。为特定行业做好一个「外设驱动」——比如面向电商的工具集、面向法律文书的文件系统层——是独立开发者可防守的小生意。
  3. 学会「画图定义讨论」这个动作:一张手绘草图统一了一个行业三年的话语框架。做技术内容的人该记住:一图胜千帖,抽象能力本身就是传播力。

延伸