AI 的下一站:从聊天机器人到工作流操作系统 封面
AI 系列

AI 的下一站:从聊天机器人到工作流操作系统

读完这篇,你能判断一个 AI 产品到底停在"会聊天的玩具"阶段,还是走到了"能接手工作的执行层";并理解持续上下文、组合式智能与 Agent 编排背后的工程取舍。

AI 未来 核心概念示意图
AI 未来:核心概念与关键组成
AI 未来 工作流程示意图
AI 未来:从输入到输出的工作流程
AI 未来 实践检查示意图
AI 未来:实践检查与迭代清单

一、演进的逻辑:从"答一句"到"跑一段"

第一代 AI 产品是单轮问答:你问一句,它答一段,上下文随对话结束而消失。它的天花板很明显——再聪明的回答,也只是"建议",执行还得靠人。真正的转折点是模型获得了工具调用(function calling)记忆能力:它不再只输出文字,而能调用 API、读写数据库、触发工作流。于是 AI 从"顾问"变成"能动手的同事"。

这背后的工程逻辑是:把"理解自然语言"和"执行确定动作"解耦。模型负责判断意图、决定调哪个工具、拼出参数;工具(你写的函数、第三方服务)负责把动作真正落地。模型不保证动作正确,但工具的可追踪、可回滚、可交接,让整个过程可控。这就是"工作流操作系统"的含义:AI 不再是独立 app,而是嵌在日程、文档、审批流里的执行层。

为什么重要:判断一个 AI 产品值不值得投入,先看它"能不能把结果写成可被系统执行的动作",而不只是"回答得漂不漂亮"。

二、持续上下文:记忆、个性化与边界

持续上下文(persistent context)指模型跨多次对话记住你的项目、偏好与历史任务。实现上分三层:

难点不在"能不能记住",而在边界:哪些内容可长期保存、哪些仅对当前任务有效、用户能否查看和删除。2025 年起,主流框架都强调"可观测的记忆"——用户能看见模型记了什么、并能一键清除。合规上这几乎是必选项(见治理篇)。

# 最简长期记忆:把对话要点存向量库,下次检索后注入
from sentence_transformers import SentenceTransformer
import faiss, numpy as np

enc = SentenceTransformer("BAAI/bge-small-zh")
index = faiss.IndexFlatL2(512)
memory = []  # 并行存文本

def remember(text):
    v = enc.encode([text]).astype("float32")
    index.add(v); memory.append(text)

def recall(query, k=3):
    q = enc.encode([query]).astype("float32")
    _, ids = index.search(q, k)
    return [memory[i] for i in ids[0] if i < len(memory)]

# 下次对话:system_prompt = "已知背景:" + "\n".join(recall(user_msg))

三、组合式智能:多模型、多 Agent 编排

最好的系统,不把一切交给单一大模型,而是组合式智能(compositional intelligence):大模型做推理与生成,小模型(如意图分类、敏感词过滤)做低成本前置,检索系统补知识,规则引擎兜底,人工审核守住高风险环节。分工的依据是性价比与可靠性——能用 7B 小模型以 1/50 成本解决的,就不必唤醒 70B 大模型。

当任务需要多步、跨工具时,就引出Agent 编排。两种主流模式:

维度监督式(Orchestrator)去中心化(Multi-Agent)
结构一个主 Agent 派发子任务多个 Agent 平等协商
可控性高,流程可预期低,结果更灵活但难复现
适用流程明确的业务(报销、运维)开放式创意/研究协作
失败面主节点成单点瓶颈Agent 互相误导、循环
监督式 Agent 编排(最常见落地形态)
用户目标规划 Agent 拆步工具 Agent 执行校验 Agent 检查汇总/回滚
主 Agent 掌握全局状态,子 Agent 各自只做一件事;每步结果可观测、可中断、可人工接管。

2024–2025 年 MCP(Model Context Protocol)把"模型怎么连工具"标准化了:工具方按统一协议暴露能力,模型方按统一协议调用,免去了每接一个 API 就改一次代码的痛苦。这是 Agent 能规模化的关键基础设施。

踩坑提醒:多 Agent 不是越多越好。Agent 之间用自然语言传递状态,容易"传错话"或陷入无限循环。先验证单 Agent + 明确工具能否解决,再谈编排;给每步加超时与最大轮次上限。

四、可衡量的价值 vs 炫技 Demo

2025–2026 的分水岭,是团队开始用业务指标而非"看起来多聪明"评估 AI:省了多少小时、少了多少错误、转化提升几个点、一次任务的人力成本下降多少。这意味着评估(evaluation)成为产品一部分——用固定测试集测准确率、用线上 A/B 看留存,而不是凭感觉。

落地时建议先选"高频率、低风险、易验证"的场景:周报生成、工单分类、信息抽取,错了能快速发现、影响可控。避开"低频但一错就出大事"的场景(如自动放款)直到治理到位。

# 用"可衡量"的思路给 Agent 打分,而非看回答顺不顺眼
eval_cases = [
  {"input": "把 7 月差旅费报销了", "expect_tool": "submit_reimbursement",
   "expect_amount_range": (3000, 3500)},
]
for c in eval_cases:
    out = agent.run(c["input"])
    ok = (out.tool == c["expect_tool"]
          and c["expect_amount_range"][0] <= out.amount <= c["expect_amount_range"][1])
    print(c["input"], "PASS" if ok else "FAIL", out)

五、2025–2026 趋势研判

把上面的线索合起来,可以看到几条清晰主线:

2025–2026 AI 应用架构演进
单模型聊天框模型+工具调用多 Agent 编排嵌入业务的执行层(OS)
横轴是"自主度",纵轴是"与业务系统的耦合深度";越往右,越需要治理与可观测(见治理篇)。

对普通人来说,下一站 AI 不会以"更会聊天"的面貌出现,而会变成悄悄嵌进日程、文档和审批流里的执行层。值得练习的,是如何把重复劳动拆成能被模型接手、又能随时收回控制的环节——理解编排与边界,比追新模型更重要。