Feiyu's Technical Blog
Notes on software, systems, and things I am learning.
Interactive study guide
LeetCode Java: Problems 1–500
Read the problem, reveal interview hints, compare solutions, and step through visual explanations alongside runnable Java code.
游戏设计文档 · 上古纪元
稳定模块接口、可见信息边界与交互流程:区分当前合同、待实现提案和已弃用设计。
这里记录现在有意义的设计。当前采用不等于整个系统已实现;每篇都写明范围和下一步。实验结果仍在下方的视觉理解系列中。
游戏智能体的模块边界:稳定接口,独立实现
Perception、Simulator、AI 如何各自改进;哪些变更必须共同讨论,以及设计文档怎样保持有效。
阅读设计 →Perception 薄观察接口:只传看见的证据
已实现的 v1 如何保存对象、数值、来源、坐标和时间,又如何防止未知值、旧帧和内部数据混进 AI。
阅读设计 →让 AI 主动查看界面:查询也要一步一步执行
完整流程仍在设计中;已有顺序探查、条件耗蓝分析和空闲窗口内的付费日志读取,保留成本与信息缺口。
阅读设计 →
已弃用的设计 · 1 篇(保留原因与替代入口)
- P02:一段录像怎样变成可审核的观察
跨模块总合同角色已被替代;保留场景分层设计,第 5 节记录 Perception 内部流水线实测及 2026-09-12 高精度 OCR 接线,不修改公开合同。
查看替代设计 →
Agents & Automation
Local models, tool-using agents, and practical information-extraction workflows.
Three Ways I Tried to Automate 1Point3Acres Daily Check-In and Quiz Answering
Direct Codex browser control, a supervised WebContentAgent library, and a fully local LLM workflow—what failed, what I use now, and what I am still exploring.
[2/2] How I Made a Codex-to-ChatGPT Bridge Verifiable
A local bridge sends one authorized request and brings back a checked answer. Its failures explain what message identity, durable state and realistic tests must get right.
[1/2] (Deprecated) How I Let Codex Talk to ChatGPT Through My Signed-In Chrome
The first prototype made the round trip work. Its failures taught me why browser mechanics need a smaller, testable home.
Local LLM + Agent for Web Information Extraction
A local agent architecture for semantic web extraction, browser automation, bounded model context, and durable task state.
游戏视觉理解 · 上古纪元
像读一本书一样:从视频选帧出发,逐步读懂文字、生物、界面和前后变化。
先读当前交付报告
最后核对:2026-09-24。p00 是总报告,其余组页逐项说明做到哪、缺什么;p900 单独保留未采用研究。下面的方法章节已按 P 任务归组,历史测量仍保留原来的范围与日期。
- p00 · 总设计与总进度先知道哪些画面能读、哪里仍缺,再决定下一项工作。
- p20 · 输入与选帧从录像留下清楚、少重复的画面,特别注意短暂悬浮。
- p40 · 场景与布局先找到页面和面板,再决定哪些区域可读。
- p60 · 文字与数值读出实际可见文字和数字,不用游戏规则替它补答案。
- p80 · 图标与视觉对象找出身体、卡片、小牌与图标;身份和位置分开评估。
- p100 · 对象与空间关系回答哪个数字属于哪个对象,不把同类生物当同一支部队。
- p120 · 组合与观察输出让各组输出有来源、未知项和时间边界,成为可检查的整帧记录。
- p140 · 数据、验收与交付工具保存可审核的数据,保证重跑、安装和清理都有依据。
- p900 · 未采用实验保留试过的方法与失败原因,不混入生产能力。
导读 · p00
先知道要看什么
一段录像最终应该留下哪些观察?先看目标,再沿处理流程往下读。
第一部 · p20
从视频挑出清楚的帧
减少重复工作,也保留短暂出现的文字与面板。
第二部 · p40
判断页面,找到可读区域
先确定这是什么画面、面板在哪里;文字怎么读,在下一部展开。
第三部 · p60
读出文字和数字
共用文字读取方法,再分别检查时钟、属性、日志、预览和状态回合。
第四部 · p80
找到并认出图像中的对象
文字之外,图标、部队身体和数量牌也需要自己的位置与身份判断。
第五部 · p100
把内容配回正确对象
名称属于哪张卡?面板对应谁?高亮位于哪些格子?这些关系单独检查。
第六部 · p120
组合前后画面的观察
多帧可以提供变化线索,但不能把后来才看见的信息提前使用。
研究附录 · p900
未采用的方法与对照
正文无需依赖这些研究。这里保留图标检索、检测器比较,以及身体—数量牌融合的有效与失败尝试。
游戏概率与数据 · 上古纪元
根据已核对的游戏数据计算竞技场概率,说明抽取事件、版本与证据范围。