一、割裂的病,要靠”权威”来治,不是靠扩词表。
内部试用的一段对话暴露了一个系统病:问”你是谁”,接着说”深入讲讲”,结果回答跟了几条对话之前的长文旧线。追下去发现根因不在某一跳漏传字段,而是意图、规划、闲聊、输出各环节**各自重新判断”现在在聊什么”**——没有谁说了算。这周没有再叠”扩词表、加改写”那一套,而是拆成四个独立小改动,一刀一个 PR:上一句的判断为权威、身份信息常驻、原话和任务分通道、残余步骤收回执行权。试用反馈的价值就在这:它提供了变量隔离的天然样本,比再猜一层路由规则值钱得多。
二、性能优化最贵的错误,是把观测口径当缺陷。
三处”疑似性能问题”,复盘之后全是口径问题:时间窗没对齐、包络算法把外围算进了关键路径、各阶段对账标准不一。没有一个真正的业务慢点。这周把性能诊断从”各阶段耗时排行”推进到”模块 / 流程 / 同步异步”三个视图分开看,并固化成六步诊断闭环。教训记死:先把墙钟和累加值拆开、把关键路径和包络拆开,再谈砍延迟。否则优化的都是不存在的瓶颈。
三、评估要能回答”真 bug 修掉没有”,而不是堆通过率。
北极星基线把短板钉死在三类:并行格式、意图、响应速度。这周把数据回归的金标、诊断分桶、空态门控、可重跑剧本全部重整,并写清一条原则:金标必须能回溯到 bug 来源。 否则绿测再多,也只是考卷,不是护栏——考卷只能证明学生做过题,护栏才能证明楼不会塌。