战场上的部队会移动,上方行动条的卡片位置则比较固定。身体、卡片、数量牌和技能图标需要不同的方法,找到位置与认出种类也要分开检查。
本页按行动卡、脚下数量、状态图标三类对象阅读。每类先看有没有框,再看内容与对象关系;后面的工程明细说明哪些仍是可选流程。
1. 先看一个例子
算法尝试集中查 P912 试验与失败笔记:数量牌支持身体有局部收益,但大框训练、补色规则和数字融合也有退步。网格联合仍待试验,不计入当前能力。
例如程序框住一只生物,却没找到脚下数量牌:这是身体检测部分成功,不是这支部队已经读全。身体和数量牌已有可选的视频处理步骤,默认流程仍未开启;识别身份、读数量和把两者配对,也还没有一起通过独立验收。
状态图标则遇到另一种断点:程序已经找到生物面板,却因为不知道整张图属于哪种场景,跳过了右下状态行。现在,经过局部检查的清楚面板可以继续读取这一行,无须先给整张图贴上“战场”标签。
2. 找到了卡片,还要知道剩多少
此前,程序能框出上方行动卡,却没有把卡片底部的小数字收进结果。整屏文字识别其实已经读到了其中不少。现在增加一步:先找到卡片,再把同帧、同位置的数字连回这张卡。

图1:上方相似卡片可能出现多次,不能仅凭生物种类配数字。程序按画面位置逐卡关联;点击原图可放大查看。
读法很简单:复用已有OCR的原尺寸、放大等原始结果,至少两次完整覆盖卡片底部的读数一致,才输出数量候选。只有一次读到、几次相互冲突或文字跨过卡片边界,就保留未知。同一个OCR模型多读几次仍可能一起出错,所以这不是多个独立模型的保证。
两段录像的六个已曝光片段共32张图,找到328个卡位,其中305个有可读数量候选。有逐卡参考的四张图共49个数字:47个相符,2个未知,没有已知错读。 两个未知位置的参考是4和77,均只有一次读法符合要求。其余图没有完整参考,不能把305/328当成准确率;本次也不验证卡片种类、当前行动者或对应战场哪支部队。
逐图报告保留全部32张图,包括选秀画面和拒识结果。展开每张卡能看到原始读法,也能跳到时间线查看数量框。参考仍待CTO审阅,不是独立验收。
这一步已接到视频流程末尾:另从原录像取3秒,30个采样点留下2张图,程序自动生成数量记录。六片段的关联回放不到1秒,只新增约0.56MiB记录,没有复制图片或整帧JSON;这不包含前面的模型和OCR耗时,也没有解决原流程的大文件问题。输入变化时旧数量会隐藏;网站本身不运行识别,也不把候选当成已审标注。
3. 脚下的牌补回来了,数字仍会读错
同一批32张图,这次只换找牌的方法:复用已有数量牌模型,不重新训练、不调阈值;找到框后,仍用原来的文字模型分别读原尺寸和三倍图。四张参考图里,原来只找到16处,如今43处都能对应上,另有1个假框。41个可读数字中,34个相符、7个拒识,其余两处参考看不清,不评分。
这里有一项标注修正需要说清:书页右侧的29原参考框偏左,程序其实已经找对、读对。按旧框仍是33/41,修正参考位置才变成34/41,不是算法又提升了一次。P83逐图对照同时保留这两种统计,参考仍待CTO。
这还不足以直接换默认算法。原先能读出的一个44现在拒识;另外查看第4帧,画面的21被两次一致读成211。同一个模型读两遍,仍可能一起犯错。 那张失败图单独保留,不混入四张首帧的分母,也不能用局部好成绩代表全部32张。
新步骤已接到可选视频入口,另从原视频取3秒实跑,自动留下2帧数量结果。32张回放只增加约1.12MiB记录,复用原图和身体框;新增步骤含模型启动共36.25秒,不含前面的选帧、整屏OCR和身体检测。原时间线目前仍显示旧数量牌层,新结果先在对照页查看。
4. 图标与提示做到哪一步
这段视频的两张圣骑兵面板各补出了一个状态图标。程序自动画框,分别用原尺寸和四倍放大读下面的小字,两种读法都是 2。图标和数字现在连到同帧面板;但“2”是否表示剩余回合、是什么效果、面板对应战场哪支部队,仍不能由此直接确认。
旧图回放又补出 43 张候选,其中 10 张能对照已有参考,39 个已标图标框全部匹配。只有其中 5 张完整标注了状态行,共 12 框,没有漏框或多框;另 5 张只核对已标位置,不能据此说整行都找全了。展开原图与候选框,可以检查它们。其余候选缺少足够标签,不算正确;这批图都曾用于开发,参考待 CTO 审阅,不是独立准确率。
这段视频的新增状态步骤约 13.8 秒,包含模型加载,不包含前面已有的整图识字。只增加约 1.27 MB 的结构化记录,没有复制截图。
随后把悬浮说明也接到局部面板入口:从一段旧录像的三个片段取全部53张已有候选,15张找到标题和正文。程序在同一张图里找状态槽,根据提示与槽位的位置关系给出候选,页面不再只有一段孤立的文字。逐图报告保留全部53张,包括没有找到和被跳过的图。
这15次都有唯一的位置候选,但我们还没有足够的明确关系标签,不能把“只找到一个候选”写成“已确定这个效果属于它”。效果身份、单位实例和剩余回合继续留空。7张清楚参考的14项文字相符,旧读法的差异仅是逗号形式,不算内容精度提升。另2张半透明提示仍进入了读取,质量检查还需要改进;默认流程没有切换。
展开工程任务、各轮测量与接线明细
最后核对:2026-09-24 · 交付进度,不是完成证明
代码、历史报告与接线盘点;跨来源整帧验收未完成。统一环境的真实模型兼容检查见 p140,不计作准确率验收。
- 整帧准确率
- 未测
- 统一环境 p50 / p95 耗时
- 未测
- 独立录像 / 已审字段
- 未汇总
p50 是一半运行能达到的耗时,p95 是 95% 运行能达到的耗时。尚未在统一环境测量,不能用某个局部模型的速度替代。
p81 · 选择页图标分类
原型 / 待接入
已有审核裁图分类;这不等于整屏找框,旧实验依赖待迁。
p82 · 战场身体检测与分类
已集成待验收
已有可选 units 视频阶段调用身体检测/分类,默认 worker 不执行;历史类别建议不等于已确认身份,独立联合验收未完成。
p83 · 数量牌定位
已集成待验收
已有51图局部入口回放;本轮固定模型再跑P02全部32图,新增紧凑可选视频步骤。四图原参考33/41数字相符;修正一处偏左参考框后34/41、7拒识,43位置全匹配、1假框。另帧21错成211单独保留。默认未换,参考待CTO,非独立验收。
p84 · 行动条卡片
已集成待验收
已把本帧原始OCR数量关联到检测卡片;完整视频入口自动追加小型结果。旧32帧328卡位中305有候选;四张参考49项47相符、2拒识,无已知错读。另3秒原视频自动产生2帧结果。参考待CTO,非独立验收;物种、当前行动者和部队对应仍未验收。
p85 · 玩家头像与颜色
原型 / 待接入
有开发证据;整帧 worker 未接入头像。
p86 · 状态图标
已集成待验收
局部状态行已有可选视频步骤;进一步把15张提示原文与同帧图标槽候选接到时间线。只按当前画面位置关联,没有关系准确率标签,身份/当前回合与单位实例仍未知。53张旧图回放里2张半透明仍通过,质量缺口保留;默认未切换。
p87 · 下栏技能图标
未实现
没有已接入的完整下栏技能输出,不能用预留模块算完成。
p88 · 图形资源条
未实现
数量牌附近血条不等于全局资源条读取;独立交付尚未建立。
已有测量能说明什么
固定整帧回放数量与修正参考相符:34/41 字段。 两录像四图,7拒识;43数量位置全匹配、1假框、2不可读不计分。原参考框有一处偏左,原评分33/41另保留;新增相符不是模型提升。其余28图无完整参考,另已发现21→211错读;助手待CTO,非独立验收。
行动卡数量与既有逐卡参考相符:47/49 字段。 两录像四张已曝光战斗首帧;按卡片顺序比较,2项只有一次读法而拒识。不是检测框IoU、物种或整帧准确率;助手参考待CTO。其余28帧无逐卡真值。
局部入口实际找到数量牌:56/58 plates。 原29候选加22真实反例全跑;同7图58牌找到56、漏2、多报3。56可读数字43对1错11拒识1漏牌;另2不可读参考。29非战斗/中断反例0放行,实际过渡未补采;助手待CTO,开发对照非全UI验收。
跨录像实际链路找到数量牌:33/58 plates。 三段已曝光录像29图实跑,七张完整可见牌面参考;模型直接56/58零多报,但实际门控后33/58、多报2。56个可读数字26对1错6拒识23上游跳过;助手待CTO,未批准训练,非全UI验收。
补通局部面板后状态图标框匹配:39/39 icons。 805条已曝光输入产生43张新增候选,其中10张/5个录像标识的39个已标框匹配;一对一IoU≥0.5。仅5张12框有完整状态行标签,漏0多报0;另5张27框不计整行精度。开发后对照、参考待CTO,非独立验收。
下一步:P02固定模型回放已补回更多数量牌;优先处理两次一致仍错读的21→211及7个拒识,复用P62固定局部读字候选,补其余32图参考。数量附加层接时间线后另留新来源验收;底栏/头像、关系与半透明反例仍缺。不优化书顶重复魔力。
5. 接下来怎么推进
行动卡和脚下数量现在都有可检查的结果,但整帧仍未读全。下一步先处理数量的错读和拒识,把新增层接回时间线,再接底栏技能和玩家头像;不会用行动条的数字偷偷补成脚下读数。法术书顶部与英雄面板重复的魔法值不再单独投入。
检查时分别回答:位置找到了吗、内容读对了吗、连到了正确部队吗?三项都要有参考,不能用数量读取成绩代替物种或对象关系成绩。
Comments