代码语言

知识点思维导图

36 个知识节点

生产工程(15) - 附录:术语表

这份术语表不要求背诵定义。 查一个词时,至少同时确认它的输入、输出、责任边界和可观察证据。 同一个名词在模型服务、应用框架和业务系统中可能指向不同对象,接口字段和 Trace 才是最终依据。

一、模型与生成

1.1 LLM

  • 定义:根据已有 Token 序列预测后续 Token 的大语言模型。
  • 输入与输出:输入 Prompt 或消息序列,输出文本、结构化数据或工具调用提议。
  • 责任边界:模型生成概率较高的结果,不保证事实正确,也不负责业务授权。
  • 验证证据:模型标识、请求参数、Token 用量、原始响应、延迟和停止原因。

1.2 Token

  • 定义:分词器把文本转换后供模型处理的离散编号。
  • 输入与输出:文本经过 tokenizer 变成 Token ID,生成结果再解码为文本。
  • 责任边界:一个 Token 不等于一个汉字或单词,不同模型的切分结果可能不同。
  • 验证证据:使用目标模型对应的 tokenizer 统计,而不是按字符数估算。

1.3 Context Window

  • 定义:一次推理可容纳的输入 Token 与输出 Token 总预算。
  • 输入与输出:系统指令、历史消息、检索材料和预留输出共同占用窗口。
  • 责任边界:窗口更大不等于模型会同等重视所有位置,也不等于请求成本不变。
  • 验证证据:输入 Token、最大输出 Token、截断策略和超限错误。

1.4 Prompt

  • 定义:为当前任务组织的指令、上下文、约束和输出契约。
  • 输入与输出:业务输入被模板组装为模型请求,模型结果再由程序校验。
  • 责任边界:Prompt 可以引导模型,不能代替权限检查、数据校验和事务控制。
  • 验证证据:模板版本、实际渲染结果、变量值、模型参数和输出 Diff。

1.5 System Message

  • 定义:由应用设置的高优先级行为约束和角色说明。
  • 输入与输出:与用户消息一起进入上下文,影响模型对任务的解释。
  • 责任边界:它不是安全沙箱,恶意输入仍可能诱导模型偏离预期。
  • 验证证据:脱敏后的最终消息序列和针对 Prompt Injection 的回归样本。

1.6 Temperature

  • 定义:影响采样分布随机程度的推理参数。
  • 输入与输出:较低值通常让相同输入的输出更稳定,较高值扩大候选差异。
  • 责任边界:低温不保证完全确定,高温也不能修复错误知识或坏 Prompt。
  • 验证证据:固定模型、输入和其他参数,重复采样并比较输出分布。

1.7 Structured Output

  • 定义:要求模型按 JSON Schema 等结构契约返回结果。
  • 输入与输出:程序提供 Schema,模型返回结构数据,应用再做解析和业务校验。
  • 责任边界:语法满足 Schema 不代表字段语义正确,更不代表允许执行副作用。
  • 验证证据:原始响应、Schema 校验结果、业务规则校验和拒绝原因。

1.8 Streaming

  • 定义:模型服务逐块发送增量结果,而不是等待完整响应后一次返回。
  • 输入与输出:服务端接收事件流,前端累积文本并处理完成或错误事件。
  • 责任边界:首块到达不代表请求成功完成,中途断流必须保留错误状态。
  • 验证证据:TTFT、事件序号、结束原因、取消信号和已发送内容长度。

二、检索增强生成

2.1 RAG

  • 定义:先从外部知识源检索证据,再把证据放入上下文辅助生成。
  • 输入与输出:查询进入检索链路,输出候选片段、引用和最终回答。
  • 责任边界:RAG 主要解决知识补充和可追溯,不自动保证召回、排序或回答正确。
  • 验证证据:语料版本、候选列表、分数、权限过滤、引用和回答 Trace。

2.2 Chunk

  • 定义:文档解析后用于索引和召回的内容单元。
  • 输入与输出:原文按标题、段落或 Token 预算切分,输出文本与 metadata。
  • 责任边界:过小会丢上下文,过大会稀释匹配信号并增加上下文成本。
  • 验证证据:原文位置、父文档 ID、Token 数、重叠范围和解析器版本。

2.3 Embedding

  • 定义:把文本或其他模态映射为可比较向量的模型输出。
  • 输入与输出:输入查询或文档片段,输出固定维度的数值向量。
  • 责任边界:不同模型或维度的向量通常不能直接混用,迁移时需要重建索引。
  • 验证证据:模型名、维度、归一化方式、距离函数和索引版本。

2.4 Vector Database

  • 定义:保存向量及 metadata,并执行近似或精确相似度检索的系统。
  • 输入与输出:写入向量和过滤字段,查询返回候选 ID、距离和 metadata。
  • 责任边界:它不是事实源;原文、权限和版本仍应由业务存储管理。
  • 验证证据:集合 Schema、索引参数、过滤表达式、召回结果和数据快照。

2.5 Sparse Retrieval

  • 定义:基于关键词或稀疏权重匹配文本的检索方式,BM25 是常见实现。
  • 输入与输出:查询词与倒排索引匹配,返回包含精确术语的文档。
  • 责任边界:擅长编号和专有名词,但可能漏掉同义表达。
  • 验证证据:分词结果、查询表达式、字段权重和候选得分。

2.6 Hybrid Search

  • 定义:合并稠密向量检索与关键词检索的候选或分数。
  • 输入与输出:同一查询走多路召回,再融合为统一候选集。
  • 责任边界:多一路召回不必然更好,需要控制重复结果、延迟和融合偏置。
  • 验证证据:各路候选、融合算法、最终排名、Recall@K 和延迟分段。

2.7 RRF

  • 定义:Reciprocal Rank Fusion,按候选在多个榜单中的名次融合排序。
  • 输入与输出:输入多组排名,输出不依赖原始分数量纲的综合排名。
  • 责任边界:RRF 只能融合已有候选,无法召回所有检索器都漏掉的文档。
  • 验证证据:各路原始名次、融合常数、最终名次和离线相关性标注。

2.8 Rerank

  • 定义:对第一阶段召回的少量候选做更精细的相关性重排。
  • 输入与输出:输入查询与候选文本对,输出相关性分数和新顺序。
  • 责任边界:重排不能补回未召回文档,候选过多会增加延迟和成本。
  • 验证证据:重排前后列表、模型版本、NDCG、延迟和截断数量。

2.9 Query Rewrite

  • 定义:根据会话或任务把用户表达改写成更适合检索的查询。
  • 输入与输出:输入原问题和必要上下文,输出一个或多个检索查询。
  • 责任边界:改写可能丢失限定条件,原问题必须保留用于对照和回答。
  • 验证证据:原查询、改写查询、召回差异和失败样本。

2.10 Citation

  • 定义:回答中的结论与原始证据位置之间的可追溯关联。
  • 输入与输出:生成阶段使用带稳定 ID 的证据,输出引用 ID 和展示链接。
  • 责任边界:出现链接不等于引用支持结论,必须验证内容蕴含关系。
  • 验证证据:引用 ID、原文片段、文档版本、访问权限和引用命中率。

三、Agent 与工具

3.1 Tool Calling

  • 定义:模型按工具 Schema 生成调用名称和参数的机制。
  • 输入与输出:模型提出调用,应用校验并执行,再把工具结果返回给模型或用户。
  • 责任边界:模型只能提议;授权、参数校验、幂等和执行必须由代码负责。
  • 验证证据:工具定义、模型提议、校验结果、执行日志和副作用记录。

3.2 Agent

  • 定义:围绕目标循环进行状态读取、决策、工具调用和结果判断的系统。
  • 输入与输出:输入目标和当前状态,输出步骤、工具结果、状态迁移与最终结果。
  • 责任边界:Agent 不应获得超出任务需要的权限,也不能无限循环或无限消费预算。
  • 验证证据:每步 Trace、最大步数、预算、检查点、人工审批和停止原因。

3.3 Workflow

  • 定义:由代码或配置明确规定节点和转移条件的流程。
  • 输入与输出:输入进入固定或条件分支,输出可以按节点逐步复现。
  • 责任边界:确定性更高但灵活性较低,未知任务不应强塞进固定分支。
  • 验证证据:流程版本、节点输入输出、状态迁移、重试和补偿记录。

3.4 MCP

  • 定义:Model Context Protocol,用统一协议暴露工具、资源和 Prompt 等能力。
  • 输入与输出:客户端发现服务能力,按协议读取资源或调用工具。
  • 责任边界:协议统一接口,不替代服务端认证、授权、审计和业务校验。
  • 验证证据:服务端能力清单、输入 Schema、权限配置、调用结果和错误响应。

3.5 Memory

  • 定义:跨轮次或跨会话保存并在后续任务中取回的信息。
  • 输入与输出:从对话或业务事件抽取记忆,按用户和场景检索后注入上下文。
  • 责任边界:记忆不是权威数据库,可能过期、冲突或包含不应长期保存的数据。
  • 验证证据:来源、写入原因、用户范围、过期时间、检索命中和删除记录。

3.6 Checkpoint

  • 定义:工作流或 Agent 在某一步保存的可恢复状态快照。
  • 输入与输出:持久化当前节点、状态和版本,恢复时从一致位置继续。
  • 责任边界:检查点不能自动消除已发生的外部副作用,需要幂等或补偿机制。
  • 验证证据:运行 ID、状态版本、写入时机、恢复记录和副作用键。

四、评测与可观测性

4.1 Eval

  • 定义:用固定样本、指标和判定规则评估 AI 系统质量的过程。
  • 输入与输出:输入数据集和候选系统,输出逐样本结果、聚合指标与失败分类。
  • 责任边界:单一平均分不能代表生产质量,必须覆盖关键切片和失败边界。
  • 验证证据:数据集版本、评分器版本、逐样本记录、置信区间和回归阈值。

4.2 LLM-as-Judge

  • 定义:使用模型依据 Rubric 对另一个模型或系统输出评分。
  • 输入与输出:输入问题、候选回答、参考材料和评分标准,输出分数与理由。
  • 责任边界:评审模型也有偏差,不能作为唯一发布依据或替代高风险人工审核。
  • 验证证据:评审模型版本、Rubric、顺序扰动测试和人工一致性样本。

4.3 Trace

  • 定义:记录一次请求跨组件执行过程的结构化链路。
  • 输入与输出:各阶段产生 span,统一关联为可查询的调用树和时间线。
  • 责任边界:Trace 需要脱敏和采样策略,缺少业务字段时也无法定位语义错误。
  • 验证证据:Trace ID、span 父子关系、输入摘要、耗时、错误和版本标签。

4.4 TTFT

  • 定义:Time To First Token,从请求开始到首个生成 Token 到达的时间。
  • 输入与输出:由排队、网络、Prompt 处理和首轮解码共同影响。
  • 责任边界:TTFT 只描述首响应体验,不能代表完整生成耗时或吞吐。
  • 验证证据:客户端与服务端时间戳、输入 Token、排队时间和 Prefill 时间。

4.5 TPOT

  • 定义:Time Per Output Token,稳定解码阶段每个输出 Token 的平均耗时。
  • 输入与输出:输出 Token 时间间隔聚合为解码速度指标。
  • 责任边界:短回答样本不稳定,跨模型比较时要控制硬件、批次和输出长度。
  • 验证证据:逐 Token 时间戳、输出长度、批次大小和硬件配置。

4.6 Hallucination

  • 定义:模型输出缺少输入或可靠证据支持,却以事实语气表达的内容。
  • 输入与输出:可能表现为虚构事实、错误引用、错误计算或不受支持的推断。
  • 责任边界:措辞流畅不代表可信;应用要通过检索、校验和拒答降低风险。
  • 验证证据:原输入、引用证据、事实核验结果和错误类型标注。

五、安全与生产边界

5.1 Prompt Injection

  • 定义:不可信输入试图覆盖指令、窃取上下文或诱导系统执行越权动作。
  • 输入与输出:攻击内容可能来自用户、网页、文档、工具结果或记忆。
  • 责任边界:只追加“忽略攻击”类 Prompt 不能构成可靠防护。
  • 验证证据:信任边界、输入来源、工具授权、攻击样本和拒绝日志。

5.2 Guardrail

  • 定义:在输入、生成、工具执行或输出阶段实施的约束与检测机制。
  • 输入与输出:规则或模型检查内容,输出允许、拒绝、降级或转人工判断。
  • 责任边界:Guardrail 有误报和漏报,必须配合最小权限与业务校验。
  • 验证证据:规则版本、命中原因、混淆矩阵、绕过样本和人工复核。

5.3 Idempotency

  • 定义:同一业务请求重复执行时不会产生重复副作用的性质。
  • 输入与输出:请求携带稳定幂等键,服务端返回首次执行结果或一致冲突。
  • 责任边界:网络重试本身不提供幂等,数据库写入和外部调用都要设计去重。
  • 验证证据:幂等键、唯一约束、重复请求日志和最终业务状态。

5.4 Rate Limit

  • 定义:限制单位时间内请求、Token 或并发数量的服务策略。
  • 输入与输出:超限请求通常返回明确状态或错误码,调用方按策略退避或降级。
  • 责任边界:无上限重试会放大拥塞;不同模型和租户配额可能不同。
  • 验证证据:响应头、错误体、重试次数、退避时间和队列长度。

5.5 Fallback

  • 定义:主模型或主链路不可用时切换到受控替代路径的策略。
  • 输入与输出:触发条件成立后选择备用模型、缓存结果、规则回答或人工处理。
  • 责任边界:降级必须明确质量损失,不能静默返回不满足契约的结果。
  • 验证证据:触发原因、路由决策、候选差异、用户提示和恢复时间。

六、容易混淆的决策

需要区分 核心差异 选择依据
RAG 与微调 RAG 注入外部知识;微调主要改变模型行为或任务适配 知识更新频率、可追溯要求、样本量和成本
Agent 与 Workflow Agent 动态选择步骤;Workflow 预先规定状态转移 任务未知程度、风险、可复现性和审批要求
Tool Calling 与 Agent Tool Calling 是一次调用机制;Agent 是多步控制循环 是否需要持续状态、重试、停止和目标判断
Memory 与业务数据库 Memory 服务上下文;数据库保存权威业务事实 数据一致性、审计、权限和删除要求
Vector DB 与知识源 Vector DB 优化相似检索;知识源保存原文和版本 可追溯、更新、权限和灾备要求
Eval 与在线监控 Eval 比较受控样本;监控观察真实流量 发布门禁与运行期告警要同时存在
Structured Output 与业务校验 前者约束结构;后者判断字段是否合法 格式正确后仍需权限、范围和状态检查

七、查术语时的最小记录

  1. 写出该对象真实接收的输入,不使用“数据”概括所有字段。
  2. 写出它产生的输出以及输出由谁消费。
  3. 标出它不负责的事情,防止把安全或一致性责任交给模型。
  4. 记录能够在日志、Trace、数据库或测试中看到的证据。
  5. 固定库、模型、协议和 Schema 版本,避免同名异义。
  6. 为失败情况给出错误码、停止条件或人工接管方式。

八、总结

  • 模型层:LLM 负责生成,应用仍要校验事实、结构、权限和副作用。
  • 检索层:RAG 的质量由解析、召回、过滤、排序、引用和生成共同决定。
  • 执行层:Tool Calling 只产生提议,Agent 和 Workflow 必须受代码状态机与权限约束。
  • 评测层:离线 Eval、在线指标和逐请求 Trace 分别回答质量、趋势和根因问题。
  • 生产层:限流、幂等、降级与安全边界决定系统失败时是否可控。