Mini UFlash:为 Unlimited-OCR 探索 Windows 本地投机解码 #1
ZhiYiTree
announced in
Announcements
Replies: 0 comments
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
Mini UFlash:为 Unlimited-OCR 探索 Windows 本地投机解码
一个面向 8GB 级 Windows 设备、受 DFlash / 混元 OCR 思路启发的 Unlimited-OCR 投机解码参考实现。
仓库:https://github.com/ZhiYiTree/mini-uflash-ocr-windows
更细的自我评估:HONEST_STATUS.md · 测法:../train/GOLD_BASELINE.md
从哪里来
Mini UFlash 起源于一个很直接的问题:
经过训练与工程适配,项目已经串起:
草稿模型训练 → 本地推理 → 固定页 A/B 墙钟 → 失败记录。
需要先说清楚:
当前实现
推理流程(示意)
相对「盲写 commit」的实验路径,这里强调:只有 target 认过的前缀才进状态。
当前结果(诚实版)
测试环境:Windows 原生 · 约 8GB 级 笔记本 GPU · 固定金标准页(5 scored + warmup)。
墙钟口径:
官方 stable 耗时 / 加速路径耗时(>1 表示加速更快)。在线观测(同批实验量级):
这些数字只说明当前工程状态,不能外推到所有文档类型与硬件。
完整表与跑次目录见
train/GOLD_BASELINE.md。必须说明的限制
1. Fast 的「快」与截断绑定
Fast 的明显加速,很大程度来自 soft / hard 长度策略(低 τ 提前停写、硬顶 token)。
2. 关掉截断之后
关闭 soft 后,lossless 约 0.95× 官方速度。
也就是说:现有权重还不能支持「完整输出 + 稳定快于官方」。
3. 当前主要瓶颈
4. 叙事边界
为什么现在开源
项目已经到了适合公开协作的阶段:
希望把 代码、权重获取方式、基准方法、失败记录 一起摊开,方便一起判断:
Help Wanted
1. 在线轨迹与 Hard Mining
从真实推理轨迹中找:
目标:验证 hard mining 能否抬 live τ,而不只是 offline 指标。
2. OCR 质量评估
速度数据目前比质量数据完整。需要补充:
3. Windows 性能复现
欢迎在不同设备上跑统一 manifest,尤其:
报告请尽量包含:GPU、显存、Python/PyTorch/CUDA、文档类型、官方耗时、加速耗时、输出长度、τ、B1 占比、档位与是否 soft。
4. 投机解码与 Cache
5. 工程与文档
安装、网页、错误提示、教程、基准脚本、实验记录整理——都很欢迎。
如何参与
setup_full.ps1+ Release 权重,跑自己的文档;请不要只写「比官方快」或「比官方慢」。
有价值的报告至少有:环境、输入、模式、双方耗时与输出长度、τ / B1、质量差异、复现步骤。
当前定位
如果你关心 OCR、投机解码、草稿模型、Windows 推理或评估协议——欢迎一起推。
成功的实验会留下。失败的实验也会留下。
希望这个仓库最终是一套可被复现、质疑和继续推进的公开实现,而不只是只展示最好数字的 Demo。
All reactions