换一副眼镜看 LLM:不是聊天机器人,是操作系统内核
一句话
卡帕西提议换一个心智模型:别把 LLM 理解成「会聊天的机器人」,把它理解成一个正在成形的新操作系统的内核进程——它调度记忆与计算资源,协调各种外设和工具来解决问题。这条推是「LLM OS」概念的起点,也是后来整个 agent 架构讨论的思想原型。
他说了什么
他的表述很短,核心是一次视角切换:
"the kernel process of a new Operating System" —— @karpathy,2023-09-28 · 查看原推 →
展开说:在这个类比里,LLM 像 CPU/内核,上下文窗口像内存(RAM)——内核进程负责把解决问题所需的信息「换页」进出这块有限的内存,并调度外部资源:文件、工具、网络、其他进程。聊天只是这个系统碰巧最先流行的一个「应用程序」,而不是它的本体。
背景:2023 年秋,聊天框开始长出手脚
时间点很关键。2023 年春天 AutoGPT 掀起第一波 agent 狂热又迅速退潮;到 9 月底,ChatGPT 正相继获得联网浏览、代码解释器、语音和视觉能力——一个纯文本聊天框正在长出「外设」。当时业界主流仍用「chatbot」框架理解这一切,讨论停留在「聊天体验」层面。卡帕西(时在 OpenAI)看到的是系统层的事实:模型正在成为协调各种资源的中枢。用操作系统作类比,把散落的功能(工具调用、检索、多模态)统一进了一张架构图的雏形。
它引发了什么
- 六周后的那张图:2023 年 11 月他画出了著名的 LLM OS 架构图,把这条推的文字类比可视化——LLM 居中如 CPU,上下文窗口是 RAM,四周挂着文件系统、工具、浏览器等外设。
- 进入他的经典演讲:同年 11 月底的《大语言模型入门》一小时视频以 LLM OS 收尾,把这个框架讲给了数百万观众;2025 年 YC 演讲中它再次升级,与 Software 3.0 叙事合流。
- 被 agent 时代验证:2024–2026 年,行业沿着这张蓝图逐步兑现——工具调用成为模型标配、RAG 对应磁盘换页、上下文管理成为显学(context engineering)、多 agent 协作对应进程间通信。今天所谓 agent harness / runtime,本质上就是在给这个「内核」写外围系统。
- 一批创业公司直接以「LLM OS」立项:这个词成了品类名,尽管多数产品只实现了类比的一角。
对你意味着什么
- 用 OS 视角规划学习地图:想系统掌握 agent 开发,就按内核类比拆解成几门「课」:上下文/内存管理、工具调用、检索(文件系统)、多 agent 通信、安全边界。每一块都有现成的最佳实践,比追热点框架更不会过时。
- 做应用的机会在「外设」和「应用层」:内核(前沿模型)是巨头的战场,但外设驱动(垂直工具集成)和应用程序(面向具体场景的 agent)是独立开发者的沃土——就像 PC 时代多数人不写内核,写应用一样赚钱。
- 上下文窗口是你的 RAM,要像管内存一样管它:这个类比的实操含义是:别把所有东西塞进 prompt,要设计好什么信息何时换入换出。这正是从「会用 ChatGPT」到「能做出可靠 agent」之间的分水岭。
延伸
- 解读:那张著名的 LLM OS 架构图 —— 六周后的可视化
- 视频:《大语言模型入门》(Intro to LLMs) —— 演讲版完整展开
- 解读:「是智能体十年,不是智能体元年」 —— 内核之上的系统要建多久
- 解读:Software 3.0 —— 2025 年的合流