AI 的下一站:从聊天机器人到工作流操作系统
读完这篇,你能判断一个 AI 产品到底停在"会聊天的玩具"阶段,还是走到了"能接手工作的执行层";并理解持续上下文、组合式智能与 Agent 编排背后的工程取舍。
一、演进的逻辑:从"答一句"到"跑一段"
第一代 AI 产品是单轮问答:你问一句,它答一段,上下文随对话结束而消失。它的天花板很明显——再聪明的回答,也只是"建议",执行还得靠人。真正的转折点是模型获得了工具调用(function calling)与记忆能力:它不再只输出文字,而能调用 API、读写数据库、触发工作流。于是 AI 从"顾问"变成"能动手的同事"。
这背后的工程逻辑是:把"理解自然语言"和"执行确定动作"解耦。模型负责判断意图、决定调哪个工具、拼出参数;工具(你写的函数、第三方服务)负责把动作真正落地。模型不保证动作正确,但工具的可追踪、可回滚、可交接,让整个过程可控。这就是"工作流操作系统"的含义:AI 不再是独立 app,而是嵌在日程、文档、审批流里的执行层。
二、持续上下文:记忆、个性化与边界
持续上下文(persistent context)指模型跨多次对话记住你的项目、偏好与历史任务。实现上分三层:
- 会话记忆:短期,存于当前对话上下文,便宜但随窗口溢出丢失。
- 长期记忆:把重要事实写入向量库或结构化存储,需要时检索回来(RAG 思路)。
- 用户画像:偏好、语气、常用工具,作为系统提示的一部分注入。
难点不在"能不能记住",而在边界:哪些内容可长期保存、哪些仅对当前任务有效、用户能否查看和删除。2025 年起,主流框架都强调"可观测的记忆"——用户能看见模型记了什么、并能一键清除。合规上这几乎是必选项(见治理篇)。
# 最简长期记忆:把对话要点存向量库,下次检索后注入
from sentence_transformers import SentenceTransformer
import faiss, numpy as np
enc = SentenceTransformer("BAAI/bge-small-zh")
index = faiss.IndexFlatL2(512)
memory = [] # 并行存文本
def remember(text):
v = enc.encode([text]).astype("float32")
index.add(v); memory.append(text)
def recall(query, k=3):
q = enc.encode([query]).astype("float32")
_, ids = index.search(q, k)
return [memory[i] for i in ids[0] if i < len(memory)]
# 下次对话:system_prompt = "已知背景:" + "\n".join(recall(user_msg))
三、组合式智能:多模型、多 Agent 编排
最好的系统,不把一切交给单一大模型,而是组合式智能(compositional intelligence):大模型做推理与生成,小模型(如意图分类、敏感词过滤)做低成本前置,检索系统补知识,规则引擎兜底,人工审核守住高风险环节。分工的依据是性价比与可靠性——能用 7B 小模型以 1/50 成本解决的,就不必唤醒 70B 大模型。
当任务需要多步、跨工具时,就引出Agent 编排。两种主流模式:
| 维度 | 监督式(Orchestrator) | 去中心化(Multi-Agent) |
|---|---|---|
| 结构 | 一个主 Agent 派发子任务 | 多个 Agent 平等协商 |
| 可控性 | 高,流程可预期 | 低,结果更灵活但难复现 |
| 适用 | 流程明确的业务(报销、运维) | 开放式创意/研究协作 |
| 失败面 | 主节点成单点瓶颈 | Agent 互相误导、循环 |
2024–2025 年 MCP(Model Context Protocol)把"模型怎么连工具"标准化了:工具方按统一协议暴露能力,模型方按统一协议调用,免去了每接一个 API 就改一次代码的痛苦。这是 Agent 能规模化的关键基础设施。
四、可衡量的价值 vs 炫技 Demo
2025–2026 的分水岭,是团队开始用业务指标而非"看起来多聪明"评估 AI:省了多少小时、少了多少错误、转化提升几个点、一次任务的人力成本下降多少。这意味着评估(evaluation)成为产品一部分——用固定测试集测准确率、用线上 A/B 看留存,而不是凭感觉。
落地时建议先选"高频率、低风险、易验证"的场景:周报生成、工单分类、信息抽取,错了能快速发现、影响可控。避开"低频但一错就出大事"的场景(如自动放款)直到治理到位。
# 用"可衡量"的思路给 Agent 打分,而非看回答顺不顺眼
eval_cases = [
{"input": "把 7 月差旅费报销了", "expect_tool": "submit_reimbursement",
"expect_amount_range": (3000, 3500)},
]
for c in eval_cases:
out = agent.run(c["input"])
ok = (out.tool == c["expect_tool"]
and c["expect_amount_range"][0] <= out.amount <= c["expect_amount_range"][1])
print(c["input"], "PASS" if ok else "FAIL", out)
五、2025–2026 趋势研判
把上面的线索合起来,可以看到几条清晰主线:
- 推理模型普及:o 系列、DeepSeek-R1 类"先想后答"的模型,把多步规划质量拉高,Agent 更敢接复杂任务。
- 端侧/小模型崛起:手机、电脑本地跑的轻量模型承担隐私敏感、低延迟的前置任务。
- 协议标准化:MCP、Agent 间通信协议让"积木式组装"成为可能。
- 从 Demo 到 OS:AI 不再是一个聊天框,而是嵌入审批、文档、日程的执行层。
对普通人来说,下一站 AI 不会以"更会聊天"的面貌出现,而会变成悄悄嵌进日程、文档和审批流里的执行层。值得练习的,是如何把重复劳动拆成能被模型接手、又能随时收回控制的环节——理解编排与边界,比追新模型更重要。