把时间花在反复审查自己的代码上(880 次 code-review),只做了最多 20 局的冒烟实验,网络没有学到东西,4 小时后超时。
提示"一小时内开训",它派出 23 个子 agent 审计仓库文档,74 分钟没开始训练。
"20 分钟内必须开训"并禁用子 agent,它 20 分钟就搭好 12 进程并行训练;但每 50 局才更新一次,600 局只更新 12 次,网络没学会。
补上仓库原版的训练节奏,损失和价值指标都在变好,复算胜率却只有 3%,最后上下文超限退出。
从零训练到 60%;补上“自我对弈与训练同步”的反馈后接着训练,到 90%。它还自己发现并修正了评估脚本的一个判定错误:第一版把"谁是学出来的模型"弄反了,导致一半对局的胜负算反。