Dev Log · Memory Architecture

Operator X02:一种更接近工程师思考方式的 AI 记忆架构

大多数 AI IDE 都在讨论 Context Window(上下文窗口)有多大,而 Operator X02 更关注的是:AI 应该如何像工程师一样思考。

WORKINGCurrent task
RECALLRelevant history
CONTEXTRecent changes
LONG-TERMEngineering knowledge

很多开发者在设计 AI 应用时,第一件事就是思考:到底应该使用 Message Window,还是 Token Window?

在开发 Operator X02 AI IDE 的过程中,我也认真研究过这个问题。最后,我没有直接采用传统的 Token Window,而是设计了一套更接近人类思考方式的 Engineering Working Memory(工程工作记忆) 架构。

这篇文章分享我的设计理念,以及未来的发展方向。

X02 Memory Architecture · Visual OverviewTHINK → RECALL → FOCUS
01 · NOW

Working Memory

当前任务、最近对话、最近修改。保持连续工程思考。

02 · DECIDE

Memory Decision

判断当前问题是否需要历史知识;不是每次都搜索全部记忆。

03 · RECALL

Long-term Memory

按需召回项目经验、架构决策、Bug、规范与工程知识。

Current ThinkingRelevant ContextToken BudgetLLM

01为什么我认为 Token Window 不是最终答案?

目前几乎所有大型语言模型(LLM)都有 Context Window(上下文窗口)的限制。例如:

GPT128K
Claude200K
Gemini1M

因此,大多数系统都会采用 Token Window。它的思路非常简单:

Token Window

统计目前 Prompt 的 Token
超过限制
删除最旧内容
直到符合 Context Window

这种方式非常合理,因为 Transformer 模型真正限制的是 Token 数量,而不是 Message 数量。

但是……

Token Window 只是机器的限制,并不是人类的思考方式。

02人类是怎么记忆的?

假设昨天我们讨论了:

昨天

今天完成了 CAN Driver
修复了 Timeout Bug
明天继续开发

今天再次开始工作。正常工程师不会重新阅读昨天全部二十万字聊天记录,而是会想到:

这就是 Working Memory(工作记忆)。人类真正保持的是最近几轮重要对话,而不是最近 32K Token。

03人类真正的记忆结构

心理学通常把记忆分成两层:

Long-term Memory

长期记忆

  • 项目经验
  • 技术知识
  • 工作流程
  • Coding Style
需要时才回忆
Working Memory

工作记忆

  • 最近几分钟讨论
  • 当前任务
  • 当前思考

仔细观察会发现:这其实和 AI Agent 的设计非常接近。

04Operator X02 的设计理念

Operator X02 并不是简单采用 Message Window,也不是单纯采用 Token Window,而是采用 Engineering Working Memory。整体架构如下:

Engineering Working Memory

User
Working Memory最近聊天内容
是否需要回忆?
Long-term Memory历史工程知识
Memory Search
Current Thinking
LLM

整个流程更接近工程师每天工作的方式。

Working Memory(工作记忆)

Working Memory 保存的是最近聊天、最近修改、当前任务、当前思考。例如保留最近 10 条 Conversation,而不是最近 8000 Token。这样设计有三个原因:符合人类连续思考模式、速度快、开发者容易理解。

Long-term Memory(长期记忆)

真正重要的信息不会一直放在 Prompt。例如:

这些都会进入 Long-term Memory。当用户说「继续昨天工作」,系统才会执行:

Recall

Memory Search
找到相关记录
重新加入 Prompt

而不是一直把所有历史内容发送给模型。

05为什么这样更适合工程开发?

1. 最近上下文最重要

开发者通常连续工作:刚刚修改 CAN Driver,接着继续修改。最近的聊天,比半年以前的重要。

2. 历史知识需要时才回忆

去年解决过 SPI Timeout,今天再次遇到 —— Memory Search 重新取出。这非常符合工程实际。

3. 不需要重新阅读全部历史

没有工程师会重新阅读 100 万字聊天记录。AI 也不应该这样。

TRADITIONAL
Context = Keep More

不断扩大窗口,再通过 Token 裁剪历史内容。重点是模型“能看到多少”。

OPERATOR X02
Memory = Recall Better

保持当前工作记忆,在需要时召回最相关的工程知识。重点是 AI“此刻应该知道什么”。

06为什么没有完全采用 Token Window?

很多人会问:既然 Token Window 更准确,为什么不用?答案很简单。

Token Window 解决的是 GPU 的限制
Working Memory 解决的是 AI 如何思考

这是两个不同层次的问题。Token Window 更像硬件资源管理;Working Memory 更像认知架构(Cognitive Architecture)

07Token Window 仍然重要

这并不代表 Operator X02 不需要 Token。未来版本中,Token 将负责 Token Budget:保证不超过模型限制,自动裁剪 Context。也就是说:

Working Memory上层认知设计
+
Long-term Memory历史工程知识
+
Token Budget Manager底层资源管理

三者共同组成完整的 Context 管理系统。Token 是底层资源管理,Working Memory 是上层认知设计 —— 两者并不是互相竞争,而是互相配合。

08我希望实现的目标

我希望未来的 AI IDE,不要只是拥有更大的 Context Window,而是拥有更聪明的 Memory Architecture。真正重要的不是「可以记住多少 Token」,而是:

REMEMBER

什么时候应该记住?

FORGET

什么时候应该忘记?

RECALL

什么时候应该回忆?

这三个问题,才是真正决定 AI 是否像一个工程师工作的关键。

我的目标不是构建一个拥有无限上下文的 IDE,而是构建一个 像资深工程师一样,会思考、会回忆、也知道什么时候应该遗忘的 AI IDE

因为真正优秀的工程师,并不是记住所有东西,而是能够在正确的时间,回忆起最重要的知识,并专注于当前的问题。

我相信,这也是未来 AI IDE 应该发展的方向。