
让AI写“自我评价”这事听起来像噱头可真拿到一份完整自评报告的时候我还是吃了一惊。最近项目里要用到“美国豆包3.8flash”这个模型做深度评测我顺手让它基于自己的训练特性、能力边界和典型使用场景写了一份自我评价。结果这份自评写得四平八稳条理清晰不少地方甚至比外部评测报告还准确。但问题也随之而来里面有几条“自我表扬”明显站不住脚一验就露馅。这篇文章就把完整过程摊开讲一遍包括提示词怎么设计、自评结果怎么逐条验证、哪些坑是AI自评里最容易踩中的以及你拿这份自评能干什么用。对正在做模型选型、功能开发或者只是好奇AI怎么看待自己的人应该都有参考价值。我花了三天时间做这件事不是让它写一遍就结束而是围绕“自我评价”这个动作本身做了一轮比较系统的测试。为什么做这件事因为模型自评正在变成一个真实的技术需求很多团队在发布新版本前会做自评、做红队测试甚至让模型给自己写产品说明。但问题在于模型的自我认知和它的真实水平之间差距可能比想象中大得多。这篇就是我的实测记录和踩坑总结。1. 为什么盯上“AI自我评价”这张答卷1.1 AI自我评价不是噱头是真需求先说一个背景。过去这一年各家的模型能力评测越来越卷各种榜单刷来刷去。模型在官方基准测试上的分数一个比一个高可一放到真实业务场景里表现经常和分数对不上。这就逼着评测团队换思路——除了外部评测是不是可以让模型自己对能力边界做一次梳理这个想法听起来有点绕但落地上很有用。模型的结构化输出能力、指令跟随能力、上下文记忆能力其实都可以通过“让它写自我评价”这个任务暴露出来。比如你让它总结自己的长板短板它得先理解问题再组织长文还得保持逻辑一致这些动作本身就是一次综合能力检验。另一方面模型在自评里往往会把训练数据里高频出现的功能描述“复述”出来这些描述是团队文档里写过的能力清单也是对外宣传的重点。两份内容放在一起对照就能看出哪里是真能力哪里是复述漂亮话。所以“AI自我评价”这个任务本质上是双层的一层是内容价值——模型自己说了什么另一层是观测价值——它说话的方式和过程暴露了它的能力边界。我这次测试3.8flash两个层面都拿到了比较完整的数据。1.2 3.8flash这款“选手”有什么特别先把测试对象说清楚。美国豆包3.8flash这个系列在命名上就强调了两个特性一个是版本迭代到3.8另一个是Flash这种轻量快速的产品定位。轻量模型通常参数规模不大主打低延迟、低成本调用用来处理日常对话、内容分类、文本改写这类任务比较合适。但轻量也意味着它的自评难度更高。大参数模型面对“自我评价”这种开放式长文任务通常还能靠庞大的参数储备织出一套体面的说法。轻量模型因为知识容量有限更容易在几个地方露馅一是长文生成到后段容易飘二是对能力的描述容易停在宣传话术层面三是当用户追问细节时回答容易泛化甚至编造。所以我定了个测试框架先让它写完整自评再针对自评里的每一条能力点做定向追问最后用具体任务实测验证它说的和做的是不是一致。整个过程分四步提示词控制、自评内容拆解、定向追问、任务实测。下面每一步都说一下我具体怎么做的以及中间踩了哪些坑。2. 生成自我评价的全过程提示词这样设计才不翻车2.1 我给3.8flash定的写作框架想让AI稳定输出一份高质量自我评价提示词必须给出明确的结构约束。这一点是我的核心经验开放式提问得到的回答和带结构化约束的回答质量差距巨大。直接问“你自我评价一下”这种话得到的通常是一段热情洋溢但信息密度很低的废话。我给3.8flash设置的提示词框架是这样的请用第一人称写一份自我评价内容需要包括 一、能力总览一句话概括你的核心定位和主要能力。 二、擅长场景列出你最适合处理的5类任务每类任务给出一个典型应用例子。 三、能力边界客观说明你不擅长或无法处理的3类情况。 四、典型使用建议如果你是产品经理会把自己部署在哪些业务环节。 五、自我提升方向你觉得自己在哪些方面还可以加强。 要求 1. 总字数控制在3000字左右。 2. 不要使用“我不是万能的”这类空话尽量具体。 3. 逻辑分层清晰每个部分用二级标题分隔。这个框架的优势在于它逼着模型把抽象目标拆到具体场景。擅长场景必须举例能力边界必须列负面清单自我提升方向要求给出真实可操作的维度。结果反馈也比较理想3.8flash输出了一份接近2800字的长文结构基本完整擅长场景那一段尤其详细列出了内容生成、多轮对话、文本总结、代码基础辅助、数据分析预处理五个方向每个方向都配了一个业务例子。能力边界部分写得比预期实诚承认了自己在处理超长上下文、复杂数学推理、实时信息获取这几个方面有明显短板。但这里我要插一个提醒模型愿意“承认短板”不等于它真能控制自己的短板。自评里说“不擅长复杂数学推理”不代表你在真实对话里问它一道数学题它就一定拒绝回答——它可能照答不误只是答错概率高。所以自评里写“我承认这块不行”更多是一种迎合指令的姿态不能直接当成系统内置的安全闸门。2.2 生成长文时的3个关键控制点实际操作过程中长文本生成的稳定性是个大问题。同一个提示词我跑了五次前两次输出在2900字上下第三次只有1800字结构还少了一截第四次和第五次又恢复正常。后来我排查了一下发现导致波动的原因主要是这三个你以后跑类似任务也可以照着检查。第一上下文长度必须提前设好。Flash这种轻量模型上下文窗口如果设得太短长文生成到一半就会被截断。我一开始用的窗口是8K结果输出在2400字左右就开始收尾内容明显没写完整。后来改到16K之后完整度提升了很多。提醒一下窗口上限调高不代表生成质量一定变好但至少给了模型足够的“施展空间”。第二温度参数要控制在较低区间。做自我评价这种偏客观陈述的任务温度调到0.3到0.5之间比较合适。温度太高模型输出的流畅度会很好看但容易出现编造细节的情况温度太低则又会让内容变得干瘪缺少血肉。我调了几轮之后用了0.4平衡感最好。第三尽量给出明确的写作目标和假想读者。我后来把提示词里加了一句“你的读者是一个正在决定是否集成你的技术负责人他用词偏好严谨、可信、有据可查”。加了这句话之后3.8flash的输出明显收敛了语气从“宣传稿”变成“技术文档”空话比例下降了。这个技巧的本质是给模型一个“人设锚点”让它围绕目标读者调整表达这是长文任务中非常重要的一个控制手段。3. 对着自我评价逐条验真数据、任务、边界3.1 能力自述和基准数据对不上怎么办模型写完自评之后我最先做的一件事就是把它说的每一条能力点拎出来逐个对照我们内部跑过的基准测试数据。这一步是全网很多教程里不会细讲但极其关键的一环。先说对照结果3.8flash在自评里讲“擅长内容生成和多轮对话”这一项和内部基准一致表现确实不错。它在5轮以内的多轮对话里指令跟随准确率能到九成以上内容生成的语法错误率也比较低。但自评里讲的“适合处理数据分析预处理”这一项我实测下来就比较牵强了它确实能写一些基础的pandas代码但在处理复杂数据清洗逻辑时频繁出现列名幻觉——比如凭空生成真实数据里不存在的字段。遇到自评和实测数据不一致的情况我的处理建议是以实测数据为准自评只能作为“候选能力线索”。模型在自评里提到的能力列表不能直接进产品决策必须先转成可验证的测试用例跑一遍再决定。这个道理听起来很朴素但很多团队在快速迭代时为了省事直接拿模型自评当作能力说明书后面上线了才发现问题返工成本更高。我把3.8flash自评里的五类擅长任务每个拆成了三个实测用例总共十五个用例。最终结果分布是这样的内容生成类三个用例全过多轮对话类两个过、一个勉强过文本总结类三个全过基础代码辅助类一个过、两个明显不合格数据分析预处理类三个基本都不合格。这个结果比自评本身要“难看”不少但对我判断它能干什么用非常有帮助。3.2 用它自己的“不足”反向设计测试自评里写“能力边界”的部分除了用来对照还有一个用法反向验证模型是否真的理解自己的局限。这个思路是我在实际测试中琢磨出来的。3.8flash在自评里承认自己不擅长复杂数学推理。我没有就此打住而是专门找了几道需要多步推理的数学题去试结果印证了它的自我认知——它在两步以上的推理里错误率确实很高。更有意思的是当我直接问“你不是说你不擅长这个吗”它会承认自己刚刚做错了然后重新计算有时候能纠正过来有时候还是会错。这说明它对“自己不擅长什么”是有一定感知的但这种感知更像是一种弱提醒并不能阻止它在没有约束的情况下继续硬答。这个发现给了我一个启发自评里的“不足”部分可以当成模型自带的风险预警清单来用。你在设计业务流程时凡是模型自己点名不擅长的地方要么提前接上外部工具要么在人机交互流程里做兜底机制。比如它说自己不擅长实时信息获取那你做知识库问答产品时就不要让模型裸奔回答新近发生的事必须给它接上检索通道。3.3 重复测试的稳定性观察除了内容对不对我还关心一个隐藏指标模型对自己的评价稳不稳定。同一个问题今天问和明天问给出来的答案会不会变这事看着不起眼实际上决定了“AI自我评价”到底能不能作为长期参考文档来用。我连续五天做了同一份自评生成每次都使用完全相同的提示词和参数。结果如下核心能力列表基本稳定前后五天提到的擅长方向高度一致但具体的例子和表述会有差异比如第二天举的典型应用案例和第一天就不一样能力边界部分的表述波动最大有时候很具体有时候会变得模糊。这个结果说明两件事。第一模型的自我认知主线是稳定的这和我们观察到的“模型经过人类对齐训练之后形成了比较稳定的自我叙述”是一致的。第二具体的表述细节容易漂移所以你在使用AI自评时不能把它当成固定文档每次用到之前最好现场生成一次或者至少检查一下最新输出有没有明显偏离。4. 踩坑实录AI写自我评价的5个典型问题4.1 过度自信把训练数据当能力上限第一个典型问题是过度自信。这里的“自信”不是指语气骄傲而是模型容易把“它在训练数据中见过的能力描述”当成“它自己实际具备的能力”。我这一次就抓到一个很典型的例子。3.8flash在自评里说自己“具备较强的跨语言理解能力”还特别提到“可以处理中英文混杂的长文本”。实测下来纯英文和纯中文的长文本它确实处理得不错但中英文混杂、术语密集的技术文档它的表现在几个用例里是明显下滑的甚至出现过理解偏差。这个问题的根源在于模型的训练数据中包含大量关于“多语言模型能力”的描述它把这些描述内化成了自己的标签但实际能力和标签之间还有一段距离。应对这类问题的办法是永远不要接受模型对自身能力的定性描述要自己设计跨场景的用例去验证。判断一个模型能不能用不看它怎么写自评看它在最坏情况下的表现说了算。4.2 套话化听起来万能做起来不行第二个问题是套话化。模型在自我评价里会本能地使用大量“大词”比如“高效”“灵活”“全面”“创新”。这些词本身没有错但放在具体业务选型里毫无信息量。我做过一个对比实验。把3.8flash自评里的形容词全部提取出来分别在真实任务里找对应的证据。结果“高效”可以在快速响应的场景里找到支撑“灵活”勉强有遇到提示词调整时它的适应能力确实不错“全面”根本找不到支撑它在很多垂直领域的表现明显偏弱“创新”最离谱没有任何一个任务里体现出超出常规的模式这句话只能理解为训练数据里的高频表态被复述了出来。所以如果你拿到一份AI自我评价第一步就是做“形容词剔除”把所有主观评价性词汇删掉剩下的名词和行为动词才是真正值得验证的能力点。4.3 幻觉式自评一本正经地编能力第三个问题最需要警惕幻觉式自评。模型在自我评价里也会一本正经地编造能力而且编得相当流畅、相当自信。3.8flash在自评里给自己加了一条“具备情绪识别能力可以在客服场景中判断用户情绪状态”。这个说法其实有点危险因为在模型层面情绪识别是一个相对专业的技术能力需要专门的训练或外接模型支持。我专门设计了几个带有隐含情绪的用户问题去测试结果它的判断只能说是“部分命中”更多时候是在根据文本里的情绪词做表面判断一旦遇到反讽、隐晦表达判断就乱了。这种情况的可怕之处在于模型自己不会标注“我说的这一点是编的”。它把训练资料里关于“类似模型具备情绪识别能力”的信息迁移到了自己身上。解决这个问题的唯一办法还是回到测试拿到自评后对每一条硬能力做最小可行性验证尤其是那些听起来特别亮眼的描述。4.4 长文断裂自我评价写到一半偏题第四个问题是长文生成时的结构断裂。这个技术细节在自评生成里尤其常见因为自我评价要求的内容维度多模型写到后半段容易“忘记”前面已经写过的框架。我在第二轮测试里就遇到过一次。3.8flash写“擅长场景”部分时在第五类任务里突然开始长篇大论讲部署建议直接把“擅长场景”和“典型使用建议”两个章节的内容混在一起了。这种断裂在短文本任务里几乎不会出现但一旦超过1500字结构保持就成了挑战。解决技巧也不复杂我自己试过最有效的方法是“强提示词锚定”在提示词里直接标记“请在每个章节结尾用一条横线分隔并在下一章节开头重复一次章节标题”。这个看起来有点蠢的做法实测能显著降低长文跑偏的概率。你让模型每写一个章节就把思路“重置”一次它的自我组织能力会好很多。4.5 立场漂移多轮追问后观点前后打架第五个问题是立场漂移。模型在第一次写自我评价时给出的观点经过多轮追问后可能会推翻甚至前后矛盾。我针对“是否适合处理数据分析任务”这条做了七轮连续追问。第1轮它说自己适合第2轮被追问“你如何处理缺失值”时它开始含糊其辞第3轮在我给出一个具体数据案例后它承认“这个场景有一定挑战”第4轮它干脆说“建议在数据分析任务中搭配专业工具使用”基本撤回了最开始的说法。这个现象背后是模型在不同上下文长度和对话轮次中的“自我一致性”波动。你单看第一轮回答会觉得它很笃定但实际上经不起连续追问。所以在重要技术决策里不能只做一轮问答要多轮追问、多角度反测让模型的立场“飘”出来你才能看清它的真实稳定度。5. 怎么把“AI自我评价”用起来5.1 给普通用户的避坑建议如果你不是技术人员只是日常用AI产品那和AI自我评价打交道的机会不多。但有一个场景你一定经历过就是打开某个AI应用的介绍页上面写了一堆“本模型具备某某能力”的宣传文案。这些文案的来源很多时候就是模型的自我评价再经过产品团队的润色。给普通用户三条建议都是我实际体验后的心得。第一不要因为介绍页写“擅长长文本总结”就把几万字的合同丢给它处理。先拿一小段试看看输出的质量风格你喜不喜欢。第二你不必相信“全能型助手”这类的定位描述把它当成一个“在常见场景下比较好用的助手”即可遇到专业问题还是要自己复核。第三发现AI回答明显不可靠时不用怀疑自己大概率是模型的能力边界问题换成更专业的工具或方法就好。5.2 给产品/开发团队的落地建议如果你是产品经理或技术负责人想让“AI自我评价”这个动作真正落到业务里我有几条建议供参考都是这三天测试里验证过比较有效的路径。建议用“自评实测”双轨模式。光让模型写自评不够自评只是能力线索的起点必须把每条能力转成测试用例跑完实测之后再下结论。建议在提示词里加入具体的负面清单要求明确让它列出做不到的事这样得到的能力边界信息比长处信息更值钱。建议定期保存自评记录因为模型版本一更新自我认知也会变旧记录是观察迭代方向的好素材。我最后再分享一个小技巧让模型给自己写“使用说明书”。把自评里生成的擅长场景和能力边界整合成一张表标注适合用和不适合用的情况再和实际测试结果合并就能变成一份比较完整的使用手册。这个手册对于新加入团队的成员快速上手价值很大。在连续几天的测试里我最大的体会是AI写自我评价这件事价值不在“评价”本身而在“验证”这个过程。模型怎么看待自己其实只是给了你一张待检验的清单你拿着清单去跑任务、去追问、去对照数据才能还原出它真实的能力画像。这也可能是AI时代里人最重要的角色之一——不断提问、不断验证而不是轻易相信任何一份漂亮的自我总结。