🌌 AI 科普系列

  1. 概念篇:从 LLM、Prompt 到 Agent ← 当前页
  2. 工具篇:从聊天框走向本地工作流

“人工智能”是一个很大的概念。1956 年的达特茅斯会议通常被视为人工智能学科的起点,此后符号推理、专家系统、机器学习、深度学习都曾成为主角。

这组文章不打算回顾完整的 AI 历史,而是聚焦我们今天最常接触的一类产品:以 **LLM(Large Language Model,大语言模型)**为核心的聊天助手和智能体。

先给出全文最重要的一句话:

大语言模型擅长根据上下文生成“最合适的下一段内容”,但它不是数据库,也不天然拥有实时信息、事实校验能力和执行权限。

理解了这句话,后面的 Token、幻觉、联网搜索、RAG、Agent 和 MCP 就都能串起来了。

LLM 到底是什么

大语言模型在海量文本、代码和其他数据上训练,从中学习词语、句子、知识与推理模式之间的统计关系。对话时,模型把输入切分成 Token,再根据已经出现的内容逐步预测后续 Token。

这听起来像“文字接龙”,但当模型规模、训练数据与训练方法达到一定程度后,它能够表现出总结、翻译、写作、问答、代码生成和多步推理等能力。程序源代码本身也是结构非常严密的文本,加上编译器、测试和静态检查能迅速反馈结果,所以软件开发很自然地成为 LLM 最早大规模落地的领域之一。

不过,“能生成像答案的文字”和“答案一定正确”是两回事。LLM 的输出是一次生成过程,不是从一个绝对可靠的知识库中逐字取回结论。

模型、产品与服务商不是一回事

日常讨论里,我们经常把三层概念混在一起:

  • 模型:真正负责理解与生成内容的神经网络,例如某个 GPT、Claude、Gemini、DeepSeek 或 Qwen 型号。
  • 产品:围绕模型做出的应用,例如 ChatGPT、Claude、Gemini、Kimi、豆包和通义。
  • 服务商:提供账号、计费、API、云端部署和安全策略的公司或平台。

同一个产品可以切换多个模型,同一个模型也可能出现在网页、API、IDE 和云平台中。比较 AI 时,应先问清楚比较的是模型能力、产品体验,还是服务价格。

目前常见的产品与模型家族包括:

生态 代表入口 常见特点
OpenAI ChatGPT 通用对话、代码、图像和工具生态较完整
Anthropic Claude 长文档、写作与智能体编程体验突出
Google Gemini 多模态能力及 Google 生态整合
DeepSeek DeepSeek 推理、代码与开放模型生态活跃
月之暗面 Kimi 长文阅读、搜索与代码场景
阿里云 通义 / Qwen 模型尺寸和模态覆盖广,开放模型丰富
智谱 AI 智谱清言 GLM 模型、办公与开发者工具
字节跳动 豆包 面向大众的聊天、语音和内容创作

这不是排名。模型更新很快,“哪一个最好”通常没有脱离任务、成本和工具环境的唯一答案。

Token:模型眼里的文字单位

LLM 并不直接按“一个汉字”或“一个英文单词”读取内容,而是先通过分词器把内容切成 Token。一个 Token 可能是一个汉字、词的一部分、标点或代码片段;不同模型使用不同的分词器,因此 Token 数不能简单横向等同。

Token 主要影响三件事:

  1. 容量:输入、历史对话、工具返回结果和输出都会占用上下文。
  2. 费用:API 通常分别按输入 Token 与输出 Token 计费。
  3. 速度:输入越长,模型读取和处理的成本通常越高;输出越长,等待时间也越长。

因此,“某套餐给了一亿 Token”并不能单独说明它更划算。模型质量、不同型号的扣费倍率、缓存计费、速度限制和任务完成率都会影响真实成本。

Context:模型一次能看到多少内容

**Context window(上下文窗口)**是一次请求中模型能够处理的 Token 总量。它通常包括:

  • 系统指令;
  • 当前问题与历史对话;
  • 上传的文件或检索到的资料;
  • 工具调用及返回结果;
  • 模型准备生成的回答。

上下文更大,并不意味着模型能对其中每个细节保持同等注意力。把整个代码仓库、几十份 PDF 和多年聊天记录一次性塞进去,常常会引入噪声,甚至挤掉真正关键的信息。

更实用的做法是:只提供与当前任务有关的文件;长任务分阶段执行;让工具先检索,再把命中的片段交给模型;在阶段切换时总结已确认的结论。

Prompt:把需求写成任务说明书

**Prompt(提示词)**就是交给模型的输入和指令。好的 Prompt 不需要堆砌“你是世界顶级专家”之类修饰语,而应把任务说清楚。

一个可靠的任务说明通常包含:

  • 目标:最终要得到什么;
  • 背景:已有材料、使用场景和读者是谁;
  • 约束:不能改什么,必须遵守什么格式;
  • 验收标准:怎样才算完成;
  • 示例:有固定风格时给一个正例往往最有效。

例如,与其只说“帮我改一下文章”,不如说:

请把下面的草稿改成面向非技术读者的科普文章。
保留作者的第一人称语气,删除未经证实的数字和营销式断言;
使用 Markdown 二级标题,每段不超过 150 字;
最后给出 5 条可执行的入门建议。

提示词也不是程序代码。模型可能误解含糊要求,小模型还可能无法同时遵守太多约束。重要任务需要检查结果,而不是迷信某条“万能 Prompt”。

Temperature 与采样

模型通常不会机械地选择概率最高的下一个 Token,而是从一组候选中采样。**Temperature(温度)**等参数会影响这种随机性:较低时结果通常更稳定、保守;较高时变化更多,也更容易跑题。

写代码、抽取数据和按模板输出时通常希望稳定;头脑风暴和创意写作可以接受更多变化。但并非所有产品都会暴露 Temperature,一些推理模型也会限制或重新解释采样参数。它只是调节生成风格,不是“准确度旋钮”。

幻觉:为什么 AI 会自信地答错

当模型生成了看似合理、实际错误或无法从给定资料中推出的内容,通常称为 Hallucination(幻觉)。常见表现包括:

  • 编造不存在的论文、链接、函数或法律条款;
  • 把过时信息当成当前事实;
  • 在缺少数据时补出精确数字;
  • 引用原文时偷换措辞;
  • 计算过程合理,但某一步算错。

减少幻觉可以从四个方向入手:

  1. 要求模型区分“已知事实、推断和不确定项”;
  2. 提供可信资料,并要求结论能够追溯到资料;
  3. 使用搜索、计算器、代码执行和测试等工具验证;
  4. 对医疗、法律、金融、安全和生产系统操作保留人工终审。

“附了引用”也不代表必然正确,还要检查链接是否存在、原文是否真的支持结论。

多模态:不只读写文字

早期 LLM 主要接受文本并输出文本。今天的 AI 产品往往加入图像、音频、视频和文档处理能力,形成更广义的多模态模型或多模态系统。

常见任务包括:

  • 图像理解:识别截图、解释图表、视觉问答;
  • 文档问答:读取 PDF、扫描件和表格后回答问题;
  • 语音交互:语音识别、实时对话、语音合成;
  • 图像与视频生成:根据文字或参考图创作新内容;
  • 跨模态检索:用文字寻找相关图片或视频片段。

可以在 Hugging Face Models 查看不同任务分类,也可以在 OpenRouter Models 按输入、输出模态筛选可调用模型。

多模态并不等于实时感知世界。模型能“看图”,可能是产品先调用视觉编码器;模型能“聊天气”,可能是系统在后台调用了天气 API。理解产品时,应该把模型自身能力和外接工具分开看。

从模型到 AI 系统

一个裸模型通常只会根据输入生成输出。现代 AI 产品则会在它周围增加系统提示、知识检索、记忆、工具、权限控制和用户界面。

可以把关系简化为:

AI 应用 = 模型 + 上下文 + 知识 + 工具 + 工作流 + 权限边界

System Prompt:预先写好的规则

系统提示词由产品或开发者提供,用来定义助手的身份、当前时间、输出风格、安全限制和工具使用规则。它通常比普通用户消息优先级更高,但也不是绝对可靠的安全边界。

RAG:先检索,再生成

**RAG(Retrieval-Augmented Generation,检索增强生成)**的核心流程是:先从文档、数据库或搜索引擎中找到相关内容,再把命中的片段交给模型回答。

它适合企业知识库、产品文档问答和需要新鲜信息的场景。RAG 能减少模型“凭记忆作答”,但检索错了、资料过期或引用片段缺少上下文时,答案仍可能出错。

Tool Calling:让模型调用工具

模型可以根据工具说明生成结构化参数,由应用实际执行搜索、计算、读写文件或调用 API,再把结果返回给模型。真正联网、发邮件或操作数据库的不是那串模型权重,而是外围应用授予的工具和权限。

这也是风险来源:工具越强,误操作的后果越大。一个只能读取天气的工具和一个能删除云资源的工具,不应使用同样的授权策略。

Agent:在反馈循环中完成任务

**AI Agent(智能体)**通常会反复执行以下循环:

理解目标 → 制定计划 → 选择工具 → 执行动作 → 观察结果 → 修正计划

例如编程 Agent 可以读取仓库、修改文件、运行测试、根据报错继续修复,直到满足验收条件。这比“一问一答”更接近交付工作,但它依然可能理解错目标、修改错文件或在错误方向上持续尝试。

Skill:把经验沉淀成可复用流程

当一类任务反复需要相同的格式、步骤和注意事项时,可以把它整理成 Skill。Prompt 更像本次任务说明;Skill 更像长期复用的操作手册。

有价值的 Skill 通常包含模型原本不知道的内容:

  • 团队怎样评审代码、发布版本;
  • 某个内部 CLI 或数据平台如何使用;
  • 项目特有的命名、测试和安全规范;
  • 经验证的模板、脚本与验收清单。

把通用百科知识大量塞进 Skill,反而会浪费上下文。好的 Skill 应按需加载细节,这种设计常被称为 progressive disclosure(渐进式披露)。可在 Agent Skills 了解这一开放格式。

MCP:连接外部系统的通用协议

**MCP(Model Context Protocol,模型上下文协议)**是一项连接 AI 应用与外部数据、工具和工作流的开放标准。它的价值类似“统一接口”:客户端不必为每个数据库、设计工具或办公系统重新发明一套接入方式。

但“支持 MCP”不代表可以无条件信任所有 MCP Server。安装前仍要确认来源、查看它暴露了哪些工具、限制可访问目录,并避免把生产凭证交给不可信服务。协议说明与示例可参考 MCP 官方文档。

订阅、API 与本地部署

订阅:为产品体验付费

ChatGPT、Claude、Gemini 等客户端通常采用免费层加月度订阅。订阅购买的是产品功能与一定范围内的使用权,通常还包含文件上传、搜索、语音或智能体工具。

“包月”不等于无限使用。服务商可能按数小时、每天、每周或模型倍率设置动态限额。套餐价格和额度变化很快,购买前应直接查看官方页面:

API:为程序调用付费

API 适合把模型接入自己的应用、自动化脚本或 Agent。费用通常与输入、输出、缓存 Token 及特殊工具有关。API Key 同时是身份凭证和计费凭证,应像密码一样管理:

  • 不要写进公开仓库、截图或前端代码;
  • 优先使用环境变量或密钥管理服务;
  • 设置预算、速率限制和异常告警;
  • 怀疑泄露时立即轮换密钥。

OpenAI 与 Anthropic 风格的接口被许多网关和工具采用,但它们并不是完全等价的统一标准。工具调用、缓存、推理参数和错误码仍可能存在差异,所谓“兼容接口”也需要实际测试。

模型可以从厂商官网、Azure、AWS Bedrock、Google Cloud、阿里云百炼、火山方舟等云平台调用,也可以通过 OpenRouter 一类聚合平台选择多个供应商。中转服务会看到请求内容,还可能影响计费、稳定性与模型真实性;敏感数据应优先选择来源清晰、条款明确且可审计的服务。

本地部署:用隐私换硬件与维护成本

本地模型的优势是数据可留在自己的设备或网络中,也能离线使用和深度定制;代价是硬件、部署、更新和推理速度都要自己负责。

仅估算模型权重,可以使用:

权重占用 ≈ 参数量 × 每参数位数 ÷ 8

例如 9B 模型采用 4-bit 量化时,权重理论值约为 4.5 GB。实际运行还需要 KV Cache、运行时缓冲区和上下文空间,所以显存或内存要留出余量。更长上下文、更高并发和更快生成都会继续增加资源需求。

量化能把权重从 16-bit 压缩到 8-bit、4-bit 甚至更低,但通常会带来不同程度的质量损失。大规模 MoE 模型虽然每次只激活部分参数,完整权重仍可能很大;消费级显卡更适合运行经过量化的小中型模型,而不是追求把云端旗舰模型原样搬回家。

本地部署前先回答三个问题:

  1. 数据是否真的不能离开本地?
  2. 任务能否由小模型稳定完成?
  3. 购买硬件是否比长期调用 API 更划算?

安全边界:能力越强,权限越要克制

联网和工具调用让 AI 更有用,也把错误从“说错一句话”扩大为“做错一件事”。尤其要留意:

  • Prompt Injection:网页、邮件或文档中夹带恶意指令,诱导 Agent 泄露数据或执行动作;
  • 过度授权:为了省一次确认,给 Agent 整块硬盘、生产数据库或管理员权限;
  • 供应链风险:安装来源不明的插件、Skill、MCP Server 或脚本;
  • 自动化放大:错误操作在批处理、定时任务或多 Agent 协作中被快速复制。

实际使用时,优先只读权限;限定工作目录;写入与外部发送分开授权;重要删除、付款、发布和生产变更必须人工确认;让日志、版本控制和备份提供可追溯与恢复能力。

怎样选择模型

不要只看排行榜,也不要默认参数最多的模型一定最合适。可以按下面的顺序试:

  1. 用自己的真实任务准备一组小型测试集;
  2. 先选能稳定完成任务的最小、最便宜模型;
  3. 对复杂推理、长上下文或高风险任务再升级模型;
  4. 同时记录成功率、延迟、Token 消耗和人工返工时间;
  5. 对关键结论使用独立资料、测试或第二个模型复核。

轻量模型适合分类、改写、翻译和高并发的固定流程;旗舰模型更适合复杂分析、跨文件修改和长链路规划。真正重要的指标不是模型在榜单上的名次,而是它在你的工作流里能否以可接受的成本交付可验证结果。

小结

LLM 提供了语言与推理能力,多模态扩展了输入输出,RAG 补充知识,工具提供行动能力,Agent 把它们组织成反馈循环,Skill 固化工作方法,MCP 则让外部系统更容易接入。

这些组件组合起来,AI 才从“会聊天的模型”变成“能完成任务的系统”。但系统越强,事实核查、最小权限、过程留痕和人工终审就越重要。

下一篇进入实践:工具篇:从聊天框走向本地工作流。