一、合规的失效方向必须主动选,而且要选对。
内容安全这块从”打补丁”升级成了三层体系:分类闸门、宽严双档、多模态评测闭环。过程中最颠覆的认知是:误拒比漏放伤害更大。 教育类、审核类、事实核查类的问题被误拦,用户不会觉得”这是安全边界”,只会觉得”这产品不行”。把默认档从紧翻宽之后,拒答套话换成了”应该怎么答”的句式,配套的路由层和出站守卫必须同批上线——否则提示词一放宽,请求就被路由层误吸走,出空音频、空图。
教训一句话:合规不是单点提示词问题,是”分类 → 路由 → 生成 → 出站 → 评测”五段契约。任何一段只改 prompt,都会在另一段爆。
二、门禁类修复的验收标准,不是”开关打开了”。
一个写操作门禁,从止血到根治隔了近一个月,中间最大的坑是把”写模块在场”偷换成了”写操作成功”——单测甚至把一个错误行为冻成了正确标准,绿灯一路亮到独立评审点名。这周落地真回执校验之后才明白:门禁修没修好,看的不是开关默认值,而是那些把错误行为冻成正确的旧测试有没有一起改。 冻错的绿测不改,下一轮评审还会拦。
三、借思想,不借运行时。
研究了某开源 Agent 框架的核心设计,做法是只吸收它的三个核心思想——统一入口、非破坏性压缩、日志与模型可见性等价——不引入它的插件体系,不换技术栈。先跑一周影子(shadow)模式拿数据,再决定往深走还是维持现状。开放归开放,底盘是自己的。