ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

【LLMAI应用开发 八股文】--1.入门认知

2026/9/5 3:37:38 拓冰建站 浏览量
【LLMAI应用开发 八股文】--1.入门认知 本专栏资料笔记来源于 卡码笔记2026最全大模型学习路线从零入门大模型应用开发完整教程RAG/Agent/微调/Transformer | 卡码笔记程序员面试题库Java、C、Go、Agent、大模型八股文前言应用开发者需要懂的讲清楚算法岗才需要深挖的点到为止就行。本专栏不是零散文章堆砌是一条从会用到懂原理的完整学习路径。目录前言1.大模型关键词全解1.1.Prompt输入1.2.System Prompt定规矩1.3.Token最小单位1.4.Context Window一眼看1.5.Hallucination幻觉1.6.Structured Output输出要求1.7.Function Calling工具调用1.8.RAG检索私有数据1.9.Embedding向量化1.10.Vector database向量数据库1.11.Fine-tuning微调1.12.Agent让模型自己跑起来1.13.MCP大模型的USB 协议1.14.Agent Skill能力的标准化封装1.15.Harness Engineering 驾驭工程2.大模型应用开发到底在做什么2.1.大模型应用开发是什么2.2.和算法岗/训练岗有什么区别2.3.应用开发者日常更关注什么2.4.为什么部署、调用、RAG、Agent 会成为核心模块3.大模型训练4.大模型蒸馏1.大模型关键词全解接触大模型满屏的英文缩写和术语Prompt、Agent、RAG、MCP、Function Calling……每个词单独搜都能搜到解释但搜完还是串不起来。这篇文章我不按字母顺序讲按从简单到复杂的顺序讲。每个概念都是因为上一个不够用了才被逼出来的。你跟着走一遍这些词就不再是散落的名词而是一条完整的进化线。1.1.Prompt输入Prompt 就是你输入给大模型的内容。你在聊天框里打帮我写一封请假邮件这个就是 Prompt。看起来很简单但同样的大模型有人用起来很强有人用起来很弱。区别在哪就在于 Prompt 怎么写。所以有了一个专门的领域Prompt Engineering研究怎么写 Prompt 才能让模型输出更好的结果。比如给模型定角色System Prompt、给几个示例Few-shot、让它一步步想CoT都是 Prompt Engineering 的具体技巧。这不是玄学是有方法的。但不管 Prompt 写得多好模型终究只是在说话它不能做事、也不能保证说的是真的。后面的每一个概念都是在弥补 Prompt 的某个短板。1.2.System Prompt定规矩普通 Prompt 是你问一句、模型答一句。但如果你想让模型始终按某种风格回答呢比如你是一个法律助手只用中文回答不要编造案例。这时候就需要System Prompt——在对话开始前给模型设定一个角色和行为规范。模型在整个对话过程中都会遵守这个设定。这是从聊天走向应用的第一步。你在 ChatGPT 里用的 GPTs本质上就是预设了一套 System Prompt。1.3.Token最小单位前面一直在说 Prompt但你有没有想过模型到底是怎么读你写的东西的它不是按字读也不是按词读是按Token读。Token 是大模型处理文本的最小单位。一个汉字通常是 1-2 个 Token一个英文单词可能是 1-3 个 Token。代码、标点、特殊符号各有各的切分规则。1.4.Context Window一眼看你跟模型聊天所有的输入——System Prompt、对话历史、RAG 检索到的文档、工具返回的结果——都装在一个窗口里这个窗口就叫上下文。而这个窗口有大小限制这就是上下文窗口Context Window。比如 GPT-5.5 的上下文窗口是 1M TokenClaude Opus 4.7 是 200KDeepSeek V4 是 1M。看起来很大但实际用起来你会发现很快就被填满System Prompt 占掉几百 TokenFew-shot 示例占掉几千 Token多轮对话历史越积越多RAG 检索的文档也要塞进来窗口满了怎么办最早的对话内容就会被挤出去——模型就忘了你前面说了什么。这就解释了几个现实问题为什么聊天聊久了模型会忘记前面的内容→ 上下文窗口有限为什么 RAG 不能把整本手册都塞进去→ 放不下只能检索最相关的片段为什么长文档场景对上下文窗口大小很敏感→ 窗口太小连文档都装不完那上下文窗口是不是越大越好也不完全是。窗口越大成本越高、延迟越高而且研究表明模型在超长上下文中可能出现Lost in the Middle现象——中间的内容模型反而注意不到。所以实际工程里不是拼命塞满上下文而是精准控制上下文里放什么。关于从 Prompt Engineering 到 Context Engineering 再到 Harness Engineering 的演进1.5.Hallucination幻觉讲到这里必须直面一个事实大模型会编造不存在的东西而且语气特别自信。问它一个不存在的人它能给你编出完整的履历问它某个 API 的用法它能编一个根本不存在的参数。这就是幻觉。幻觉不是 Bug是大模型工作方式的副产物——它本质上是在预测下一个最可能出现的 Token而不是在检索事实。幻觉的存在直接催生了后面的一系列技术Function Calling不让模型自己编答案而是让它去调用真实的接口查数据RAG把真实的文档检索出来塞进上下文让模型基于事实来回答Structured Output约束输出格式减少模型自由发挥的空间理解了幻觉你就理解了为什么后面这些技术会被需要。1.6.Structured Output输出要求模型的默认输出是自由文本想说什么说什么。但做应用开发你需要的往往是结构化数据——JSON、表格、固定字段。比如你做信息提取需要模型返回{姓名:张三,年龄:28}而不是这个人叫张三今年28岁。Structured Output就是约束模型按指定格式输出。常见方式有在 Prompt 里规定格式简单但不稳定用 JSON Schema 约束更可靠主流 API 都支持这是从聊天走向系统的关键一步——下游代码要解析模型的输出格式必须确定。1.7.Function Calling工具调用模型有两个硬伤不知道实时信息也不能操作外部系统。你问它今天北京天气它只能编。你让它帮你发封邮件它做不到。Function Calling就是解决这个问题的你给模型定义一组工具函数模型在回答时可以决定调用哪个工具你的代码负责执行再把结果返回给模型。1.8.RAG检索私有数据模型训练用的是公开数据你公司的内部文档、你上周的会议纪要、你项目的需求文档——它统统不知道。怎么办最直觉的想法把相关资料找出来塞进上下文里让模型基于这些资料来回答。这就是RAGRetrieval-Augmented Generation检索增强生成离线阶段把你的文档切成片段转成向量存进数据库在线阶段用户提问时检索最相关的片段塞进上下文模型基于这些片段回答RAG 不改模型本身而是在提问的时候给模型补充资料。这比微调成本低、更新快、也更可控。1.9.Embedding向量化RAG 说要检索最相关的片段但怎么判断相关总不能用关键词匹配吧语义相关但用词不同的内容就搜不到了。Embedding就是把文本翻译成一组数字向量语义越相近的文本向量距离越近。苹果公司发布新手机和Apple launches new iPhone用词完全不同但 Embedding 之后的向量非常接近——因为语义一样。所以 RAG 的检索不是搜关键词而是算向量距离找到语义最相近的文档片段。在Embedding 详解 (opens new window)里我们讲过Embedding 不是在生成文本而是在压缩语义。1.10.Vector database向量数据库有了 Embedding你还需要一个地方来存这些向量并且能高效地检索。普通数据库MySQL、PostgreSQL擅长精确匹配和范围查询但向量检索是找最近的邻居这是完全不同的查询模式。向量数据库就是专门做这件事的存向量、快速做相似度检索。Milvus、Pinecone、Weaviate、Qdrant 都是做这个的。1.11.Fine-tuning微调讲到 RAG很多人会问为什么不直接微调把我的数据喂给模型让它记住不就行了没那么简单。微调和 RAG 解决的是不同的问题简单说要让模型知道新知识→ RAG要让模型学会新能力→ 微调。大多数应用开发场景RAG 优先。微调是更重的武器需要明确的场景和足够的资源。1.12.Agent让模型自己跑起来有了 Function Calling模型能调用工具了有了 RAG模型有私有知识了。但到目前为止每一步还是你在操控你发 Prompt → 模型回复 → 你判断下一步 → 再发 Prompt。Agent 就是把你判断下一步这件事交给模型自己做。一个典型的 Agent 循环接收用户任务自己规划这件事分几步执行第一步调用工具 or 检索资料 or 直接回答观察结果判断是否继续如果没完成回到第 2 步任务完成输出最终结果Agent 的本质 思维链规划能力 Function Calling执行能力 循环迭代能力。所谓思维链就是让模型把推理过程一步步写出来而不是直接给结论。让模型想清楚了再行动这就是 Agent 能自主规划的基础。1.13.MCP大模型的USB 协议Agent 能调工具了但问题来了每接一个新工具就要写一套对接代码。换个大模型又得重写。这就像手机充电口——以前每个手机品牌一个接口充电器不能通用。后来统一成了 USB-C一根线充所有设备。MCPModel Context Protocol就是 AI 领域的USB-C一个标准化的协议让任何模型都能用统一的方式连接外部工具和数据源。1.14.Agent Skill能力的标准化封装最后Skill是在 Agent 和 MCP 之上的进一步抽象。Skill 把 Agent 的某个能力封装成一个可复用的技能包——就像手机上的 App装上就能用。比如文件摘要是一个 Skill代码审查是一个 Skill数据库查询是一个 Skill每个 Skill 定义了能做什么、需要什么输入、输出什么格式、依赖哪些工具。有了 Skill不同 Agent 之间可以共享能力新 Agent 不用从零开发组合现有 Skill就行能力可以独立升级不影响其他部分从 Prompt 到 Skill这就是大模型应用能力的完整进化线。1.15.Harness Engineering 驾驭工程Agent Model HarnessHarness Agent − ModelAgent 中除大模型本身之外全部代码、规则、基础设施都属于 HarnessHarness Engineering 是 2026 年初兴起的 AI Agent 工程范式不修改大模型权重在模型外部搭建一整套运行管控系统把概率性、容易跑偏的裸大模型变成生产环境稳定、可观测、可运维的业务系统腾讯云开发...。Prompt Engineering教模型听懂指令怎么说Context Engineering给模型喂正确信息看什么Harness Engineering管控模型在什么环境、什么规则下干活怎么跑Humans steer, agents execute人类负责设计系统规则Agent 负责执行任务。2.大模型应用开发到底在做什么2.1.大模型应用开发是什么很多初学者有一个误区认为大模型开发岗位是为那些高学历、强科研能力的同学设立的要用“强大的数学算法能力”去训练、微调模型。联想到自己的大学数学“三件套”微积分、线性代数、概率论早都忘光了连最基础的神经网络反向传播的原理用到的偏导、梯度下降都看不懂还怎么拥抱变革大模型“应用”开发LLM Application Development本质上是利用已经被“调教”好的、现成的大模型能力加之自己公司的业务逻辑、私有数据和外部工具构建解决实际问题的软件系统是人人都能掌握的新时代技术核心竞争力而不是需要你去科研模型的底层细节。2.2.和算法岗/训练岗有什么区别维度算法/训练岗(Algorithm/Training)应用开发岗(Application Dev)核心目标提升模型的底层能力更聪明、更通用提升业务落地效果更准确、更稳定、更便宜日常工作数据清洗、预训练、SFT 微调、RLHF、评估基准测试Prompt 工程、RAG 链路搭建、Agent 编排、API 集成、系统部署主要工具PyTorch, DeepSpeed, CUDA, HuggingFace TransformersPython/Java/Go, LangChain/LlamaIndex, Vector DB, Docker关注指标Perplexity, Accuracy, Loss, Benchmark Score首字延迟(TTFT),Token 成本,召回率,用户满意度数学要求极高线性代数、概率论、优化理论中等理解概率、向量等概念与运用即可代码风格实验性脚本为主重科研复现工程化代码为主重高并发、高可用、可维护典型产出一个新的模型权重文件 (.bin/.safetensors)一个可运行的 SaaS 服务、API 接口或内部系统如果说算法岗是研究更快更猛的发动机那么应用岗则是负责汽车硬部件的组装各组件的连接和软功能的开发RAG、Agent。2.3.应用开发者日常更关注什么转向大模型应用开发意味着工作重心的范式转移从传统的“代码逻辑实现”转向“模型能力驾驭与业务落地”不再过分钻研“古法编程”的细节而是要提高自身对业务流程的理解关注模型交互的效果开发稳定安全的产品。深入理解业务行业Know-How不再仅仅是实现一个功能而是要深刻理解业务场景、行业术语、用户痛点和商业目标。业务流程抽象建模将复杂的业务逻辑拆解、抽象成AI可以理解和执行的标准化流程。这需要定义清楚AI在流程中扮演什么角色如审核员、助手、创作者需要执行哪些具体动作如信息提取、内容生成、意图判断输入数据和期望的输出结果明确AI在哪个环节介入。模型交互与效果调优提示词工程 (Prompt Engineering)模型调用与集成数据处理与知识库构建效果评估与优化工程落地和风险控制系统集成与部署测试与监控安全与合规审查2.4.为什么部署、调用、RAG、Agent 会成为核心模块这四个模块共同构成了一个完整、可落地的企业级AI应用闭环解决了大模型从“能聊天”到“能干活”的最后一公里问题。RAG (检索增强生成)公共大模型不知道你们公司的私有数据。直接问它它就会一本正经地胡说八道幻觉。RAG便是项目落地的核心技能之一在RAG开发中我们的工作量集中在一下几点文档解析、文本切块、embedding嵌入向量数据库、检索query。Agent (智能体)解决“执行”的问题让模型从被动应答变为主动规划和执行。传统的大模型是“你问一句它答一句”的被动工具。而Agent (智能体)则能主动思考、规划并执行复杂任务调用 (工具)光有“大脑”LLM和“知识”RAG还不够AI要真正解决问题必须能对外部世界产生影响。通过定义好的工具如API、函数模型可以调用这些外部能力来执行具体操作。部署前面三者定义了应用的功能而部署则是让这些功能从代码变成稳定、可用的服务。3.大模型训练阶段数据类型训练目标产出模型核心作用预训练 PretrainTB 级无标注通用文本next‑token 预测Base 基座学习语言、海量世界知识继续预训练 CPT (可选)领域无标注文本next‑token 预测领域基座注入行业 / 领域知识SFT 监督微调指令‑回答标注对next‑token 预测SFT 模型学会听懂指令、对话格式偏好对齐 RLHF/DPO回答偏好排序数据RL 损失 / DPO 损失Chat 对话模型对齐人类偏好有用、诚实、安全4.大模型蒸馏模型蒸馏不是复制别人的模型参数而是让一个小模型学习大模型的输出行为。大模型像老师小模型像学生。老师不把脑子直接拆下来给学生但学生可以通过老师的答案、解题过程、判断偏好学会一套接近老师的答题方式。这就是蒸馏。微调让一个已有模型学习你的任务数据。比如你拿客服问答数据去训练一个模型让它更懂你公司的客服场景。微调强调的是学任务数据。蒸馏让学生模型学习老师模型的输出行为。老师可以是强模型也可以是多个模型的集成。蒸馏强调的是学老师模型。量化降低模型参数的数值精度。比如从 FP16 变成 INT8、INT4让模型占用显存更少、推理更快。量化强调的是降低计算和存储成本。剪枝删掉模型里不重要的结构。比如删掉部分神经元、通道、层让模型更小。剪枝强调的是减少模型结构规模。这几者不是互斥的。真实工程里经常组合使用先蒸馏出一个小模型再量化部署。或者先用强模型生成领域数据再 SFT 微调再做量化上线。