第一次使用 AI,先理解这 7 件事 封面
AI 系列

第一次使用 AI,先理解这 7 件事

如果你已经用过豆包、通义或 ChatGPT,却总觉得“它好像懂,又经常胡说”,这篇文章帮你把模糊的感觉换成可操作的原则:为什么模型会编、长文本为什么丢信息、token 怎么计费、以及 RAG 与 Agent 各自该什么时候上。

AI 入门 核心概念示意图
概率生成:模型并不检索事实,而是在预测下一个 token
AI 入门 工作流程示意图
一条请求的真实链路:tokenize → 上下文 → 采样生成 → 程序校验
AI 入门 实践检查示意图
实践清单:验证、脱敏、保留人工确认环节

1. 它生成的是“最可能的下一个词”,不是“检索到的真相”

大模型(LLM)的本质是一个超大规模的概率模型。给定一段上下文,它输出的是“下一个 token 的概率分布”,再按采样策略挑一个词,把这个词拼回上下文,继续预测下一个。整个过程没有数据库查询,也没有“事实核验”这一步——它只是在复述训练语料里那些语境相似时最常出现的表达。

这正是“幻觉”的根因:当上下文里没有可靠证据,而下一个词在统计上又“看起来很顺”时,模型就会自信地编造。它并不知道自己是在编,因为对模型而言,生成与事实相符的句子和生成一个合理的句子,是同一件事。理解这一点,你就不会再问“它为什么撒谎”,而是会问“我怎么让它必须依赖我给的证据”。

为什么重要:把模型当“会思考的搜索引擎”是大多数误用的起点。正确的心智模型是:它是顶级的文本模式生成器,不是知识库。凡是涉及事实、数字、法条、引用,都必须给它证据或让程序去核验。
GENERATION
上下文概率分布采样一个词拼回上下文循环
每一步都没有“查事实”,只是按概率接龙

2. 上下文窗口有硬上限,长文档要主动管理

模型一次能“看到”的 token 数量是有限的,这就是上下文窗口(context window)。2026 年主流模型普遍给到 12.8 万到 100 万 token,但“能装下”不等于“能用好”:窗口越长,注意力越容易被稀释,且成本随 token 数线性甚至超线性增长。当你的材料超过窗口,模型不会报错,而是默默截断或忽略靠后的内容——这正是“我明明贴了,它却当没看见”的常见原因。

处理长文本有三种典型策略,各有取舍:截断最简单,只保留最相关片段,但可能丢掉关键信息;压缩用模型先摘要再喂给下游,省 token 但引入摘要误差;RAG(检索增强生成)把文档切分、向量化,只检索与问题最相关的片段塞进上下文,既省 token 又保准确,代价是要搭一套检索管线和切片策略。日常聊天用截断即可,做知识库或客服才值得上 RAG。

踩坑提醒:不要一次性把整本 PDF 贴进去然后抱怨“它不看后面”。先问自己:这段信息真的进窗口了吗?是不是被前面的大段内容挤掉了?

3. token 不是字,省 token 就是省钱

模型按 token 计费,而 token 是模型词典里的最小单位,不一定等于一个汉字或单词。中文通常 1 个汉字≈1–2 个 token,英文一个词可能拆成 1–3 个 token(如“learning”拆成“learn”“ing”)。这意味着同样一段话,英文往往比中文消耗更多 token,而把提示词写得又臭又长,会直接推高每次调用的成本——尤其当你把同一段系统提示塞进多轮对话、或批量跑几千条任务时。

工程上省 token 的套路:把固定指令放进 system 提示、复用缓存;对长文档先做检索再喂片段;用结构化输出代替啰嗦自然语言;批量任务优先选便宜的小模型。一个能省 30% token 的提示重写,在百万次调用里就是实打实的预算。

TOKEN COST
中文 1 字1–2 token·英文 1 词1–3 token
计费按 token,不是按字数;精简提示=直接降本

4. RAG 与 Agent 解决的是不同问题

新手常把这两个词混为一谈。RAG 解决的是“模型不知道、但你的资料里有”的问题:它让模型在回答前先去你的文档里找依据,从而抑制幻觉、用上私有数据。Agent 解决的是“任务需要多步、要调用工具或外部系统”的问题:模型自己决定下一步调哪个函数(搜索、跑代码、查数据库、发消息),循环到任务完成。

什么时候该启用?一句话:先用普通提示把任务说清楚;当“答案不稳定是因为缺资料”时上 RAG;当“任务要做一串动作、还要跟真实系统交互”时上 Agent。新手最常见的错误是:为了一个提问就直接上 Agent 框架,结果 80% 的复杂度都花在编排上,而真正的问题用一段好提示就能解决。

你的痛点该上的方案典型信号
答案瞎编、缺内部知识RAG“它不懂我们公司的数据”
要连系统、多步执行Agent“要先查再算再发邮件”
只是格式/语气不对打磨 Prompt“说清要求就能搞定”

5. 隐私边界:个人随便用,企业先脱敏

个人用聊天产品练手,贴日常内容基本无碍,但要注意:你输入的内容可能被用于训练或留存,不要把密码、身份证、银行卡、未公开合同直接贴进去。企业场景则完全不同——把客户资料、员工信息、商业机密喂给第三方 API,可能直接触发合规与数据泄露风险。

落地脱敏的可操作步骤:第一,建立“敏感字段清单”(姓名、电话、地址、证件号、订单号);第二,在送入模型前用规则或脚本做掩码,例如把真实姓名换成“用户A”、订单号换成占位符;第三,对返回结果做反向还原只在你自己的系统里完成,模型侧始终只见脱敏版;第四,优先选用支持私有部署或企业隔离的模型。多数练习去掉真实标识后,训练/测试效果几乎不变。

# 极简脱敏:送入模型前先掩码
import re
def mask(text):
    text = re.sub(r"\d{17}[\dXx]", "ID_MASK", text)      # 身份证
    text = re.sub(r"1[3-9]\d{9}", "PHONE_MASK", text)     # 手机号
    text = re.sub(r"\b[\w.]+@[\w.]+\.\w+\b", "EMAIL_MASK", text)  # 邮箱
    return text
safe_prompt = mask(raw_input)  # 只把 safe_prompt 发给模型

6. 重要结论一定要自己验证,别盲信

因为幻觉根植于生成机制,任何会影响决策、会被他人引用、或涉及金额/法律的输出,都不能直接采用。系统性验证至少分三层:事实层(让模型给出引用来源,你再去核对原文)、逻辑层(关键数字让它分步推导,而不是跳到结论)、程序层(JSON 用 schema 校验、计算用代码复跑)。

一个实用习惯:把模型当“第一稿起草者+协作者”,而不是“终审”。让它产出、你把关。当输出拿来即用会出事时,加一道人工确认环节的成本,远低于一次错误结论的代价。

为什么重要:验证不是不信任模型,而是承认“概率生成”这一本质。把验证做成工作流的一环,而不是事后补救。

7. 真正学会 AI,是亲手跑完一个小任务

与其再记一堆概念,不如今天就挑一个每周都出现的小任务——整理会议记录、生成周报、把粗糙需求改写成开发任务卡——亲手跑完一遍,并刻意应用上面的原则:先给证据再问结论、控制 token、敏感信息脱敏、对关键输出做验证。你会在真实使用里,比读十篇文章更快摸清模型的边界与节奏。

回到起点:AI 不是搜索引擎,而是一个需要你提供证据、约束和验收的协作者。把“它会不会编”变成“我怎么让它没法编”,你就已经跨过了入门到实用的那道坎。