资讯动态

LLM/AI应用八股

发布时间:2026/9/30 14:29:39 来源:尧图企业网站定制
AI 应用八股 · Day 1 1、什么是 LLM它生成一段回答的大致原理是什么Large Language Model大语言模型LLM会根据已经给定的上下文预测下一个 Token 的概率分布并不断重复这个过程从而生成完整内容。 2、Token 是什么Token 是大模型处理文本的基本单位。模型会通过 Tokenizer分词器 将文本切分成 Token再将 Token 转换成模型可以处理的表示。Token 不等于一个单词也不保证等于一个汉字具体如何切分取决于 Tokenizer。为什么调用 LLM API 时我们会特别关注 Token 数量Token 数量会影响 API 成本、上下文窗口占用以及一定的计算开销。3 、Context Window模型一次推理时能够处理的上下文 Token 总量上限为什么做 RAG 时不能把知识库里检索到的内容全塞进 Context①Context Window 有上限② RAG 塞入大量无关内容会带来更多噪声降低回答的针对性甚至影响准确性③Token 越多通常 API 成本越高处理开销也更大。 4、PromptPrompt 是我们给模型的指令 5、System / User / AssistantSystem Message 用于设定模型的整体行为和规则你是一个...User Message 表示用户的输入Assistant Message 表示模型的回复并可共同组成多轮对话上下文。为什么多轮对话里要把之前的 Assistant Message 也作为上下文提供给模型使模型了解之前已经回答过什么从而保持多轮对话的上下文连续性 6、Temperature越高生成结果通常随机性和多样性越强越低模型越倾向选择高概率 Token输出结果通常更稳定、更确定 7、Top-PTop-P 是核采样参数它按照 Token 概率从高到低累加只在累计概率达到 P 的候选集合中进行采样从而控制生成结果的多样性8、啥是LLM 幻觉为啥会产生幻觉 第 1 题为什么纯向量检索不够模型生成了看起来非常合理、语气非常确定但实际上错误或根本不存在的信息。语言正确但是与事实相悖原因之一是 LLM 的生成机制本质上是根据已有上下文预测后续 Token而不是在生成每个 Token 时都进行事实核验因此可能生成“语言上合理但事实上错误”的内容。 9、Structured Output主要作用是让LLM稳定输出方便后端解析AI 应用八股 · Day 21、什么是 Embedding在 AI 应用/RAG 中把文本转换成向量主要是为了干什么Embedding 就是把文本等信息转换成一个由数字组成的向量用这些数字表示其语义特征。从而方便计算语义相似度并用于向量检索等任务2、为什么文本能变成向量Embedding 向量不是人工定义的而是模型通过训练学习得到的语义表示。向量通常具有很多维度语义信息分布在这些维度中因此语义相似的文本在向量空间中通常也更加接近。 3、Embedding Model、向量数据库/FAISS、LLM这三个东西在 RAG 里分别负责什么①把文本转换成语义向量②存储/索引向量并进行相似度检索存数据时/查询时③根据用户问题 检索到的上下文生成最终回答 4、什么是向量维度Embedding 维度表示向量中数值的个数语义信息通常分布在整个向量空间中不能简单把某一维对应成具体的人类语义特征。维度越高也不代表效果一定越好还需要考虑模型本身的能力以及存储和计算成本。 5、余弦相似度是干什么的余弦相似度用于衡量两个向量方向上的相似程度。通常余弦相似度越高说明两个文本的语义越相似。 6、Vector Store / Vector DB/ FAISS 是什么向量数据库①存储/索引向量②并支持高效的向量相似度检索。7、Top-K 是什么Top-K 是不是越大越好Top-K 返回相似度最高的前 K 个结果。K 不是越大越好过小可能召回不足过大可能引入噪声同时占用更多 Context Window并增加上下文和Token成本用户问“我们公司的年假最多能结转多少天”系统把问题 Embedding 后成功检索到了Top-5 Chunk。接下来是不是可以只把这 5 个 Chunk 发给 LLM还是应该把什么东西一起交给 LLM为什么把用户原问题和检索得到的 Top-K 相关 Chunk一起作为上下文交给 LLM 生成答案。 8、关键词检索 vs 向量检索关键词检索主要基于词项的字面匹配而向量检索通过 Embedding 表示文本语义再根据向量相似度进行检索。关键词检索对精确词、专有名词、编号等通常有优势而向量检索更擅长处理字面不同但语义相似的内容。因此实际 RAG 中可以结合两者进行混合检索Hybrid Search假设知识库有100 万个向量。用户每问一个问题都把查询向量和这100 万个向量逐个精确比较当然也能找到最相似的结果。那为什么实际向量检索系统还需要建立向量索引向量索引主要是为了解决什么问题向量索引主要用于提高大规模向量数据下的相似度检索效率避免每次查询都对所有向量进行暴力比较用户查询流程【用户查询】 问题 → Embedding → 检索→ Top-K用户原问题 检索到的相关内容一起作为上下文给 LLM→ LLMAI 应用八股 · Day 3☘️1、RAG 是知识库吗它到底是什么RAG 是检索增强生成它不是知识库本身而是一套先从外部知识库检索相关信息再把检索结果作为上下文交给 LLM生成答案的技术方案。☘️2、既然 LLM 本身已经有很多知识了为什么 AI 应用还需要 RAG① 让 LLM 利用外部知识② 通过提供相关、可靠的上下文降低幻觉风险☘️ 3、公司内部知识每天都在更新为什么你选择 RAG而不是每次对 LLM 进行微调”对于频繁变化的企业知识我会优先使用 RAG因为知识更新主要通过更新外部知识库完成不需要频繁调整模型参数而微调Fine-tuning主要通过训练改变模型参数更适合调整模型的特定行为、风格或任务能力。☘️4、什么是 Chunk为什么 RAG 通常要把一个很长的文档切成多个 Chunk再分别做 Embedding文档经过切分后得到的文本片段提高检索粒度和相关性避免整个长文档作为一个向量导致语义过于宽泛。☘️ 5、Chunk 是不是切得越小越好Chunk Size → 每块有多大Chunk 太大 → 语义宽泛、噪声可能更多Chunk 太小 → 上下文不完整、信息碎片化☘️ 6、Chunk Overlap 是什么为什么 RAG 切分文档时要保留一定的 Overlap相邻Chunk保留一部分重复内容这样能够减少切分边界导致的上下文丢失☘️7、 知识库是怎么构建出来的【知识库构建】 文档 → 解析(Parse) → Chunk → Embedding → 存储/索引Vector DB☘️ 8、有了 RAG为什么还会幻觉检索阶段出问题→ 没找到、找错了、相关性差。生成阶段出问题→ LLM 没有严格依据检索内容回答仍然产生错误内容。Day 4RAG 优化✴️ 第 1 题Hybrid Search既然已经有向量检索了为什么 RAG 还需要关键词检索Hybrid Search 又是什么Hybrid Search 结合关键词的精确匹配能力和向量检索的语义理解能力提升召回效果。✴️ 第 2 题RerankRerank是干什么的为什么不能把召回的所有 Chunk 都直接给 LLMRerank对第一次检索召回的候选 Chunk再做一次更精细的相关性排序。不能全丢给 LLM因为会增加上下文占用和 Token 成本还可能引入低相关噪声干扰最终答案。✴️ 第 3 题Query Rewrite查询重写Query Rewrite 是干什么的把用户原始问题改写成更清晰完整、更适合检索的查询。✴️ 第 4 题Metadata Filter元数据过滤Metadata Filter 利用文档附带的元数据先筛掉不符合条件的内容再进行后续检索。✴️ 第 5 题Recall 和 PrecisionRecall该找的找回来多少 → 别漏召回率衡量真正相关的数据中有多少被成功召回Precision找回来的有多少是真的 → 别错准确率 / 精确率衡量召回结果中有多少是真正相关的✴️ 第 6 题综合优化流程Query Rewrite查询重写→ 问得更好Metadata Filter元数据过滤→ 范围更准Hybrid Search 混合检索→ 找得更全Rerank 重排序→ 排得更准Top-K → 控制最终给多少LLM → 根据问题和资料生成答案✴️ 第 7 题综合场景题为什么 RAG 经常采用先召回较多候选 → Rerank → Top-K而不是第一次检索直接 Top-K → LLM先用低成本检索缩小范围再用高成本 Rerank 精细排序在召回效果、准确性、成本和延迟之间取得平衡。✴️ 第 8 题最终综合题公司要做一个内部 RAG用户的问题可能表达模糊知识库包含不同年份和地区既有“员工休假”这种语义问题也有ERROR-10086这种精确关键词第一次检索的排名还不一定可靠。你从用户提问开始把今天学的整个优化版 RAG 查询流程一口气说出来。提示今天学的 6 个核心组件都可以串进去。首先通过 Query Rewrite 将用户问题改写得更清晰、更适合检索再利用 Metadata Filter 根据年份、地区等元数据缩小检索范围然后通过 Hybrid Search 结合关键词检索和向量检索提高召回效果对召回的候选结果使用 Rerank 进行更精细的相关性排序再通过 Top-K 选出最相关的 K 个Chunk最后将用户原问题和 这些Chunk一起交给 LLM 生成答案。Day 5Agent 第 1 题Agent 是什么普通 LLM 主要是理解和生成内容Agent 可以围绕目标调用外部工具获取信息或执行实际操作 第 2 题Agent 的组成LLM 大脑负责判断和决策Tools 手脚负责执行操作⭐Memory/State 记住执行到哪、已经得到什么信息 第 3 题Agent 的核心循环Agent 每执行完一个 Tool 后接下来应该做什么Tool 返回的结果要进入当前任务的 State / Context再让 LLM 根据新结果决定下一步 第 4 题Agent vs WorkflowWorkflow按预先定义的流程执行。Agent根据当前任务状态和前一步结果动态决策下一步行动。 第 5 题Agent vs Tool CallingTool Calling 本身不是工具而是 LLM 选择并调用外部工具的一种机制Tool Calling 让模型“会用工具”。Agent 利用 Tool Calling 等能力围绕目标不断“决策 → 调工具 → 看结果 → 再决策”直到完成任务。 第 6 题一个很重要的坑Agent 应该在受控权限范围内自主决策对于高风险或不可逆操作需要增加权限校验、人工确认等机制而不是让模型无限自主执行 第 7 题Agent 和 RAG 的关系RAG 从外部知识库检索相关信息并把检索结果作为上下文交给 LLM 生成答案的一套技术方案。Agent 围绕任务目标根据当前状态和工具返回结果不断决策、执行、观察再决定下一步的一套机制。RAG 可以成为 Agent 使用的一种能力 / Tool。 第 8 题Agent 失败循环怎么防止 Agent 陷入无限工具调用最大执行步数最多执行 10 步超过就停止。超时限制整个任务最多运行一定时间。重复调用检测相同参数反复调用同一 Tool 时终止或换策略。失败次数限制某个 Tool 连续失败几次就停止。人工介入无法继续时让用户补充信息或确认下一步。 第 9 题Memory / StateState / Memory 到底保存的是什么保存当前任务推进所需要的状态信息 第 10 题Agent的动态循环决策 → Action → Observation看结果 → 根据结果再决策 → …… → 完成Day 6Tool Calling️ 第 1 题真正向天气 API 发请求的是 LLM 本身还是我们的后端程序LLM 负责决定“调用哪个 Tool 传什么参数”后端程序负责真正执行 Tool。️ 第 2 题假设后端给 LLM 提供了10 个 ToolLLM 怎么知道每个 Tool是干什么的、需要哪些参数name → searchOrder 工具叫什么description → 查询用户的指定订单 帮 LLM 判断什么时候用它parameters → userId、orderId 告诉 LLM 需要生成哪些参数Tool Schema 给 LLM 的工具说明书LLM 根据 Schema 选择 Tool并生成符合要求的 Arguments。️ 第 3 题Tool Calling 最核心的完整闭环。LLM选工具 填参数后端执行工具LLM读执行结果 最终回答️ 第 4 题参数出错怎么办假设 Schema 要求userId: integer结果 LLM 却生成userId 张三后端应该无脑执行还是应该先做某件事为什么LLM 生成参数 →后端校验参数 → 校验通过才执行 Tool。️ 第 5 题参数校验应该满足类型是否合法 值是否符合业务规则 当前用户是否有权限 高风险操作是否需要确认。️ 第 6 题开始接近真实开发现在把前面串起来用户“帮我查用户 1001 的订单 A9527。”你从用户说话开始一直讲到LLM 最终回答用户。尽量把这几个东西都带上Tool Schema、LLM、Arguments、后端校验、执行 Tool、Tool Result。用户提出需求后LLM 根据 Tool Schema 判断并选择需要调用的 Tool同时生成对应的 Arguments实参后端收到 Tool Call调哪个工具 这次传什么 Arguments 后对参数和权限进行校验然后真正执行 Tool得到 Tool Result 后再交给 LLM最后由 LLM 结合执行结果生成最终回答。️ 第 7 题Tool Result 出错有限重试 / 备用 Tool / 错误处理策略。️ 第 8 题Schema 设计重点是让 name 和 description 有明确的业务语义和边界。️ 第 9 题最终大串Tool Calling 是让 LLM 能够使用外部工具的一种机制。应用程序提前向 LLM 提供 Tool Schema描述工具的功能和参数要求。LLM 根据用户需求选择合适的工具生成包含工具名称和 Arguments 的 Tool Call。后端收到请求后进行参数校验和权限检查再真正执行工具。最后将 Tool Result 返回给 LLM由 LLM 根据结果生成最终回答或者决定是否继续调用其他工具。 Day 7MCP Tool Calling AgentMCP 是一套让 AI 应用按照统一标准连接和使用外部工具、数据源等能力的协议Tool Calling 是让 LLM 能够选择并调用外部工具的机制Agent 则围绕任务目标进行决策通过 Tool Calling 使用工具并根据 Tool Result / Observation 不断进行下一步决策直到完成任务。LLM 大脑负责理解和决策Tool Calling 调工具的机制MCP Client 使用方AI 应用侧负责连接和使用 MCP Server 的组件。MCP Server 提供方把外部能力按 MCP 标准提供出来(外部能力的标准化接入协议)MCP 就是给 AI 应用接外部能力定了一套统一标准。有了这个标准别人做好的 MCP Server 我也能直接接入复用不用每次都自己重新适配。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑