AI

AI 技术

面向开发者解析大模型、Agent、RAG、推理优化、评估体系与 AI 工程化实践。

41 篇文章

大模型结构化输出:JSON Mode 与函数调用的机制、失败模式与工程选型

以自动生成业务报表为场景,解析大模型结构化输出的三种实现路径:仅提示词的 JSON 模式、约束解码(原生结构化输出)与函数调用,以及验证加重试的后处理方案。对比 OpenAI JSON Mode、函数调用与开源约束解码的差异,分析格式错误、内容截断、模式切换等失败模式,并给出工程选型与校验建议。

滑动窗口注意力:局部窗口与全局缓存如何支撑长文本高效推理

以长文档摘要为场景,解析滑动窗口注意力如何通过限制注意力范围将计算复杂度从平方降为线性,并借助跨层信息传递与KV缓存轮转保留远距离信息。对比全局注意力与稀疏注意力,分析显存、延迟与质量权衡,以及窗口大小对困惑度的影响。

大模型文本水印:Kirchenbauer 方法的红绿列表偏置与检测可靠性

本文以识别 AI 生成文本为场景,深入解析 Kirchenbauer 水印方法:如何在生成时通过偏置 logits 嵌入信号,如何用统计检验检测,以及硬水印与软水印的差异。同时探讨低熵文本、翻译和改写攻击下的鲁棒性,帮助读者理解水印的适用边界与工程权衡。

Graph RAG 如何通过知识图谱增强大模型的多跳推理与事实一致性

本文以医疗问答为场景,解析 Graph RAG 如何通过知识图谱的结构化信息解决传统 RAG 在多跳问答中的推理断裂与幻觉问题。内容涵盖图构建、实体链接、图检索与推理路径生成,对比向量检索与 Text-to-Cypher,并讨论索引更新、查询延迟与领域迁移的工程权衡。

多向量检索:ColBERT 的迟交互机制如何平衡检索精度与索引成本

在企业知识库等细粒度文档检索场景中,单向量模型常因信息压缩而遗漏细节,交叉编码器虽精确却计算昂贵。本文以 ColBERT 的迟交互机制为核心,解释其如何通过 token 级向量匹配提升精度,并对比单向量与交叉编码器的延迟和存储开销,同时讨论索引压缩与近似搜索的工程权衡。

AI 推理系列(十二):Attention Sink——为什么删除最早几个 Token,会让大模型突然“失忆”?

围绕长期 Agent 与流式推理中 KV Cache 持续增长的问题,解释 Attention Sink 为何使纯滑动窗口在删除初始 Token 后出现质量退化,以及 StreamingLLM 如何保留少量 Sink Token 与最近窗口,在固定缓存预算下持续处理数据流,并分析它与真正长上下文和长期记忆的边界。

Medusa 多头投机解码:通过并行候选头加速大模型推理

大模型自回归解码受限于顺序生成,每次只能输出一个 token,导致高延迟和低硬件利用率。Medusa 在原始模型上附加多个预测头,一次生成多个候选 token,并通过树状注意力并行验证,显著减少解码步骤。本文以在线聊天服务为场景,拆解其训练流程、树状注意力机制、典型接受方案,并与传统投机解码对比,分析候选接受率对加速比的影响及适用边界。

LLM-as-Judge 评估偏差:位置偏见与冗长偏好如何影响大模型评判可靠性

在自动评估问答质量时,用大模型当裁判会引入位置偏见和冗长偏好,导致评分随答案顺序或长度变化,扭曲模型对比结果。本文以企业知识库问答评估为场景,剖析这两种偏差的成因,对比交换位置、校准评分等缓解策略,并讨论它们对排行榜和迭代决策的误导风险。

工具调用代理的错误恢复:从重试、回退到人工干预的工程策略

当 LLM Agent 调用外部 API 失败时,简单的重试往往不够。本文以旅行预订助手为场景,分析 API 异常、参数错误和超时等故障模式,对比 ReAct 的自我修正、Toolformer 的过滤机制与基于规则的恢复,讨论重试次数、回退策略与人工介入的工程实现,帮助开发者在自动化与可靠性之间做出权衡。

重排序模型在 RAG 中的精度-延迟权衡:交叉编码器与双编码器的对比

本文聚焦 RAG 检索后重排序阶段,以多路召回融合为场景,对比交叉编码器(如 BGE-reranker)与双编码器在精度和延迟上的差异。通过分析级联架构、模型蒸馏与批处理优化,解释重排序如何缓解“中间丢失”问题,帮助读者在工程实践中做出权衡。

自动规划工具使用:从 ReAct 到 Toolformer 的工程演进

大模型调用外部工具时,如何自动解析 API 文档、生成动作序列并处理错误?本文以企业客服查询系统为贯穿场景,对比 ReAct 的推理-行动交织与 Toolformer 的自监督工具学习,剖析二者在复杂 API 场景下的规划策略、鲁棒工具选择与执行验证方案,并给出工程权衡与常见失败模式。

大模型幻觉自动评估:TruthfulQA 与 HaluEval 的机理、指标与工程权衡

聚焦 TruthfulQA 与 HaluEval 两个代表性基准,解析它们在设计机理、评估指标和生成式模型对抗性评估上的异同。文章以企业知识库问答为贯穿场景,讨论指标效度、跨领域泛化不足等挑战,并探索结合人工评估与自动评估的工程实践,帮助读者理解幻觉评估的适用边界与部署决策。

过程监督如何提升大模型数学推理:从 PRM800K 到自动化的实践与挑战

本文以 OpenAI 的 Let's Verify Step by Step 为切入点,剖析过程监督相比结果监督在数学推理中的优势。重点讨论过程奖励模型训练数据的构建、步骤级人工标注的成本与自动化替代方案(如 Math-Shepherd),以及在 Lean 等形式化验证环境中的应用潜力和挑战。