从0到1:企业级AI项目迭代日记 Vol.78|不只是更名,还有更隐蔽的事

当你把旧名字从全仓每一行里删掉,你才知道它在多少地方活着。

这24小时最大的事,是品牌更名。从系统配置到演示文稿,所有出现旧名字的地方,全部替换为新的。做过全仓更名的人都知道:这不只是一次全局替换,而是一次系统级的清点。名字出现的每一处——数据库、文档注释、测试断言、运行时配置——都是它曾经被使用过的证据。

一、76个长期失效的测试

更名的同一轮,修了一大批长期未通过的配置测试。

这些测试不是因为这次更名才坏的。它们在过去某个时间点开始失效,但因为不在主路径上,没有阻断任何发布,于是就静静地失败着,没有人去修。

这类问题有个共性:它们不疼,所以被推后;被推后久了,变成背景噪声;变成背景噪声之后,某天你去看,才发现已经积累到这个量级了。

系统健康度不靠感觉判断,靠测试通过率。感觉良好的时候,往往是你没有去看那个数字。

二、静默失效:本地模型断了很久,没人知道

这轮还修了两个问题。一个是本地模型连接,已经不可用一段时间了,根因是两个配置参数同时缺位,任何一个单独修都不够;另一个是知识库嵌入服务,长期处于漏配状态,文档里的示例值从未被真正写进运行环境。

两个问题的共同特征:影响的都是“非核心但真实在用”的路径,不影响主服务运行,所以从未触发告警,从未被修。直到有人主动去检查对应功能,才发现它们一直是坏的。

三、评测体系:知道系统在变好还是变坏

这轮启动了系统性的评测建设。核心问题是:AI能力有没有在提升,你怎么知道?

过去的回答是“感觉上是的”。现在在做的,是把这个问题变成可量化的答案——定义评测场景格式、搭执行框架、建立分层抽样通道,让每次迭代都能看到实际的准确率变化。

同时修了采样逻辑里的一个错误:采样上限参数原本被误用为单类上限,导致实际返回的总量远低于预期。修正后,同样的参数能返回正确数量的样本,评测结果的置信度大幅提升。

不能测量的改进,不算改进。

四、身份切换的安全门禁

安全这条线这轮加固了身份切换的多道门禁:异常时拒绝旧身份入口,检索工具的运行时身份被锁定,身份兼容事件与时间戳合法性纳入严格校验。

身份切换是企业AI里一个不太被关注的攻击面——系统以什么身份在做事、执行的权限边界在哪里,如果没有门禁,操控空间会很大。这轮把这些漏网路径逐一收口。

名字是系统对外宣称的身份。改掉名字容易,清理它留下的痕迹才是真正的更名。

这,是第七十八天。

《从0到1:企业级AI项目迭代日记》记录一个企业级 AI 项目从创意、架构到落地的真实过程。不讲神话,只记录进化。


如果你也在做企业 AI 落地,欢迎留言来聊。或者,把这篇转发给一个正在踩同样坑的朋友。