
一个 AI Coding Agent 能持续运行多久?这个问题的答案正在从"几分钟"变成"几小时",目标是"几天几周"。
2026年3月,三件事在同一周发生:Claude 插件组合 Superpowers + Ralph-Loop 发布、字节开源 DeerFlow 2.0 获得 47.3k Stars、周晓在 D2 演讲提出 Harness Engineering。它们指向同一个命题——
能不能长期做事、能不能跨工具做事、能不能在复杂环境里稳定做事。
这个命题的回答,正在重塑 AI 编程的基础设施。
一、三个核心问题
7x24 持续运行不是"一直开着就行",是三个递进问题的叠加:
| 问题层级 | 具体含义 | 技术挑战 | 当前状态 |
|---|---|---|---|
| 能不能长期做事 | 任务执行时间从分钟级 → 小时级 → 天级 | token 限制、上下文衰减、错误累积 | 小时级已实现,天级在探索 |
| 能不能跨工具做事 | 单一工具 → 多工具协同 → 跨平台 | 工具链衔接、状态同步、权限管理 | 多工具已成熟,跨平台在实验 |
| 能不能在复杂环境里稳定做事 | 简单任务 → 复杂项目 → 多项目并行 | 环境隔离、任务优先级、人机协作 | 复杂项目有方案,多项目待突破 |
这三个问题不是独立存在,而是相互制约——
想长期做事,就必须跨工具(否则单一工具的瓶颈会打断任务);想跨工具,就必须环境隔离(否则工具冲突会污染状态);想环境隔离,就必须人机协作机制(否则人工干预的成本会指数上升)。
7x24 不是时间问题,是架构问题。
二、四层技术方案
从 local 到 remote,持续运行能力逐层跃升:
Level 1:本地单次运行(基础层)
最原始的形态。AI 编程工具从 2022 年的 GitHub Copilot 到 2025 年的 Claude Code,本质都是这个层级——
一次对话、一个任务、一段时间。会话结束,上下文消失。
| 工具 | 运行模式 | 持续时间 | 核心限制 |
|---|---|---|---|
| GitHub Copilot | 实时补全 | 分钟级 | 无自主性,需人工驱动 |
| Cursor Composer | 单次任务 | 分钟级 | 对话窗口限制 |
| Claude Code | 单次任务 | 10-30分钟 | token + 上下文窗口 |
| Gemini CLI | 单次任务 | 10-30分钟 | 同上 |
痛点:上下文不持久、工具不衔接、任务不自主。
Level 2:本地持久化(tmux 层)
用一个工具解决一个核心问题:会话不丢。
Tmux 的三个特性恰好对应 AI 编程的三个痛点:
| Tmux 特性 | AI 编程痛点 | 解决方案 |
|---|---|---|
| 会话持久 | AI 会话中断后上下文丢失 | 后台常驻,断线重连 |
| 一屏多用 | 多工具切换时状态混乱 | 多窗口并行,各跑各的 |
| 分屏操作 | 人机协作时窗口抢占 | 左边 AI 干活,右边人工监控 |
社区最推荐的多 Agent 方案是 Git Worktree + tmux 并行化——
每个 Agent 一个独立的 worktree(隔离代码),一个独立的 tmux 窗口(隔离终端),并行干活,最后合并。
这不是"一直开着",是"开了不丢"。 解决的是稳定性,不是自主性。
Level 3:本地多 Agent 协作(Harness 层)
这是 2026 年 3 月的焦点。
两个代表性方案:
| 项目 | 核心机制 | 关键技术 | Star 数 |
|---|---|---|---|
| Superpowers + Ralph-Loop | 规划 → 执行 → 自我验证 → 循环 | fs + git 操作、Ralph 循环、规划引擎 | - |
| DeerFlow 2.0 | sub-agents + memory + sandbox | 47.3k Stars(暴涨) | 47.3k |
DeerFlow 的架构:
- sub-agents:主 Agent 指派子 Agent,分工协作
- memory/context:跨任务的知识沉淀,不每次从头开始
- sandbox skills:隔离环境,工具封装,安全边界
周晓在 D2 演讲的核心观点:
Agents Team(master-worker)、人机协作、Spec/Plan — 从单兵到团队作战。
这不是"一个 AI 干很多事",是"多个 AI 各干一件事,然后协作完成一个大任务"。
Agent = Model + Harness。 Model 是大脑,Harness 是驾驭框架——规划、分工、验证、循环。
Level 4:云端持续运行(Remote 层)
把本地依赖变成云端服务。
Qoder 的 Quest Mode 是典型代表:
| 模式 | 运行位置 | 执行方式 | 结果交付 |
|---|---|---|---|
| Quest Mode (local) | 本地 | 前台执行 | 直接写入 |
| Quest Mode (remote) | 云端 | 后台常驻 | apply 到本地或发起 GitHub PR |
云端运行意味着——
- 不依赖本地机器状态(关机、断网不影响)
- 不依赖本地资源限制(云端 token 更大、模型更强)
- 不依赖人工在场(下班后还能继续干)
这是真正的 7x24 的第一步:物理层面的持续运行。
三、演进路线(时间线)
2026年3月,三条线在同一周交汇:
| 时间 | 事件 | 关键点 | 影响层级 |
|---|---|---|---|
| 03-18 | Superpowers + Ralph-Loop 发布 | 插件组合大幅提升效果 | Level 3 |
| 03-18 | Harness Engineering 概念文章 | Agent = Model + Harness 定义 | Level 3 概念层 |
| 03-23 | 周晓 D2 演讲 | 从上下文工程到 Harness Engineering | Level 3 行业层 |
| 03-26 | DeerFlow 2.0 开源 | 47.3k Stars,sub-agents 架构 | Level 3 开源层 |
| 03-26 | tmux 教程 + 终端基建 | Git Worktree + tmux 并行化 | Level 2 实战层 |
| 03-26 | Qoder Quest Mode remote | 云端运行,apply 或 PR | Level 4 产品层 |
一周之内,从基础层到云端层全部有进展。
这不是巧合,是命题的成熟——行业同时意识到:持续运行是下一个瓶颈。
四、实战指南(分层路径)
按使用深度和用户类型分层:
一、零门槛使用(普通开发者)
目标:让 AI 任务不中断。
最简方案:tmux。
# 10 分钟学会 tmux
tmux new -s ai-coding # 创建会话
tmux detach # 断开但不关闭
tmux attach -t ai-coding # 重连会话
| 操作 | 效果 |
|---|---|
| 会话 detach | AI 继续跑,你去做别的 |
| 会话 attach | 回来时上下文还在 |
| 多窗口分屏 | 一个跑 Claude,一个跑测试,一个看日志 |
不需要懂 Harness,只需要懂 tmux。 会话不丢,就是第一步。
二、进阶使用(重度 AI 编程用户)
目标:多 Agent 并行协作。
方案:Git Worktree + tmux + Claude Code。
| 步骤 | 命令 | 说明 |
|---|---|---|
| 1 | git worktree add ../feature-a -b feature-a |
创建独立分支目录 |
| 2 | cd ../feature-a && tmux new -s agent-a |
进入目录,创建会话 |
| 3 | 在 tmux 里启动 Claude Code | Agent A 开始干活 |
| 4 | 重复 1-3,创建 Agent B、C... | 多 Agent 并行 |
| 5 | git worktree list |
查看所有分支状态 |
| 6 | 完成后合并 |
git merge 或 PR |
每个 Agent 一个 worktree、一个 tmux 窗口。 代码隔离、终端隔离、任务隔离。
三、高级使用(Harness 架构搭建者)
目标:构建自主循环机制。
方案:Superpowers + Ralph-Loop 或 DeerFlow。
Superpowers 的循环机制:
规划 → 执行 → fs/git 操作 → 自我验证 → 发现问题 → 重新规划 → 循环
DeerFlow 的 sub-agents 架构:
主 Agent → 拆解任务 → 指派子 Agent → 各自执行 → 结果汇总 → 验证 → 循环
| 架构要素 | Superpowers | DeerFlow |
|---|---|---|
| 规划引擎 | 有 | 有 |
| 自我验证 | Ralph 循环 | sandbox + memory |
| 工具封装 | fs + git | skills + tools |
| 多 Agent | 待完善 | sub-agents 核心机制 |
| 状态持久 | 本地文件 | memory/context |
四、云端使用(追求物理级 7x24)
目标:不依赖本地机器。
方案:Qoder Quest Mode (remote)。
| 模式 | 适用场景 | 操作 |
|---|---|---|
| remote + apply | 本地项目,云端执行 | 云端跑完,一键同步到本地 |
| remote + PR | 团队项目,云端执行 | 云端跑完,自动创建 GitHub PR |
下班提交任务,第二天早上看结果。 物理层面的 7x24。
五、核心洞见:Harness Engineering 的本质
周晓在 D2 演讲提出的关键概念:
Agent = Model + Harness
这不是简单的"框架 + 模型",是对 AI 编程的本质拆解——
| 组成部分 | 定义 | 核心能力 | 挑战 |
|---|---|---|---|
| Model | 大模型本身 | 理解、生成、推理 | token 限制、上下文衰减 |
| Harness | 驾驭框架 | 规划、分工、验证、循环 | 如何让 Model 不失控 |
Harness 的四个核心能力:
| 能力 | 作用 | 实现方式 |
|---|---|---|
| 规划 | 把大任务拆成小任务 | Spec → Plan → Tasks |
| 分工 | 把小任务分给不同 Agent | sub-agents、worktree |
| 验证 | 检查执行结果是否正确 | 自我验证、测试、人机协作 |
| 循环 | 发现问题后重新规划 | Ralph 循环、迭代机制 |
核心洞见:
| 洞见 | 解释 |
|---|---|
| 上下文衰减是不可避免的 | Model 的 token 限制决定了单次对话无法持续 |
| Harness 的作用是"绕过"衰减 | 通过规划、分工、验证、循环,让上下文在多个小对话中"接力" |
| 人机协作是 Harness 的必需品 | 完全自主的 Agent 会失控,人工验证点是安全阀 |
| 7x24 的本质是架构,不是时间 | 不是让一个 AI 跑 24 小时,是让多个 AI 在 24 小时里接力完成一个大任务 |
当 Harness 架构成熟后,持续运行不再是技术瓶颈,而是成本瓶颈。
六、写在最后
7x24 持续运行的核心价值不是"让 AI 一直干活"——
是把"几分钟的 AI 编程"变成"几小时的自主任务",把"单次对话"变成"多轮循环",把"一个 Agent"变成"Agent 团队"。
这背后需要的不是更强的模型,是更成熟的 Harness 架构——规划、分工、验证、循环。
最终愿景:AI 编程从"实时辅助"变成"自主交付"。
技术方案索引:
| 方案 | 类型 | 链接 |
|---|---|---|
| tmux 教程 | Level 2 | https://mp.weixin.qq.com/s/NaJX5t3aTEmHz7BNkYOzpg |
| tmux + Git Worktree | Level 2 | https://mp.weixin.qq.com/s/7l4o8F9xTErrV9pQOT6eiw |
| Superpowers + Ralph-Loop | Level 3 | https://mp.weixin.qq.com/s/5Dngyi2AtTp6fFop853wSw |
| Harness Engineering | Level 3 概念 | https://mp.weixin.qq.com/s/YYurQM9EUuyshuW20YAMJQ |
| DeerFlow 2.0 | Level 3 开源 | https://mp.weixin.qq.com/s/xhs6yYJtT6ZGEDdijg8D0fw |
| 周晓 D2 演讲 | Level 3 行业 | https://mp.weixin.qq.com/s/ERSjcq9YURHvlsdTUv_Paw |
| Qoder Quest Mode | Level 4 | https://docs.qoder.com/zh/user-guide/quest-mode |
调研 & 撰写:AI(opencode+GLM)
主导 & 审校:dayday
创作时间:约 15 分钟(素材整理 5 分钟 + 写作 10 分钟)