图片多不代表训练数据好,测试通过也不代表画面读得准。这一组负责把图片、标签、独立测试、运行环境和磁盘产物整理成能检查、能复现的工作流程。

本页分清三种交付:数据是否可审核,程序是否能在统一环境运行,以及识别是否通过验收。它们各有证据,不能相互替代。

1. 先看一个例子

例如一批模型自动标注只能叫建议,不能算用户已审。又如清理旧环境前,必须先在统一环境里实际跑过 OCR、检测与小训练,否则删掉的可能仍是唯一能运行的依赖。

2. 当前做到哪一步

这一轮先把运行环境统一了。 读文字、检测生物、读行动条、跑小训练和启动标注网站,现在都能使用同一个 Python 环境。不同识别引擎仍各自在子进程运行,就像共用一个工具箱、各自开工;不用再维护一套套环境。

我们没有趁机换模型,而是把同一张战斗截图和同一张法术书截图分别交给新旧环境。身体候选、行动条候选,以及传统 OCR 的文字、位置和分数都相同。小训练还实际更新了权重、重新载入并核对输出;临时权重随后删除,没有替换正在使用的模型。旧环境还保留,等剩余调用入口核对完再清理。

这只说明原来的功能能够搬过来。额外测试视觉语言 OCR 的整页输入时,它反复输出同一个数字,最后达到输出长度上限。程序跑完了,内容却没有读好;这项结果不能算识别成功,也不代表局部裁图的读法已经通过验收。

展开工程任务、各轮测量与接线明细

最后核对:2026-09-23 · 交付进度,不是完成证明

代码、历史报告与接线盘点;跨来源整帧验收未完成。统一环境的真实模型兼容检查见 p140,不计作准确率验收。

整帧准确率
未测
统一环境 p50 / p95 耗时
未测
独立录像 / 已审字段
未汇总

p50 是一半运行能达到的耗时,p95 是 95% 运行能达到的耗时。尚未在统一环境测量,不能用某个局部模型的速度替代。

p141 · 数据与审核状态

原型 / 待接入

已有数据目录与审核网站;跨批统计与独立测试集尚未统一。

p142 · 标注网站

已集成待验收

本地审阅路由已存在;各组完整输出仍需汇入统一入口。

p143 · 质量与速度评估

原型 / 待接入

已有局部实验结果;统一环境整帧准确率与耗时未测。

p144 · 统一 Python 环境

已集成待验收

统一环境真实模型与原视频短窗口可运行;活动源码不再硬编码旧环境。历史实验调用、模型目录与旧环境退役仍待审计。

p145 · 存储与清理

原型 / 待接入

已盘点风险和保留数据;尚未执行本次删除。

已有测量能说明什么

本组还没有整帧质量与速度的验收结果。环境检查和历史局部测量不能代替它们。

下一步:短视频基本链路续跑与 10 分钟选帧内存检查已通过;按活动引用清单退役旧环境,并冻结跨来源 UI 参考,不动原视频与审核数据。

返回 p00 总报告 · 全部阅读目录

3. 接下来怎么推进

先让每项成绩都能回到明确的数据批次、原图和运行配置;参考被修正时保留旧评分,算法改变时另外记录新评分。再补一份按完整录像隔离、未参与调参的验收集。交付时同步本地审阅入口和博客结论,不只更新总数。

读完这一组,可以回到 p00 总报告,再决定要深入哪个问题。 更多历史方法仍可在 阅读目录 查阅。