开云kaiyun.com也难怪它一开源就火了-kai云体育app官方下载app最新版本-kai云体育app官方登录入口

两东谈主小团队,仅用两周就复刻了之前被硅谷夸疯的 DeepSeek-OCR??
复刻版名叫DeepOCR,收复了原版低 token 高压缩的中枢上风,还在要津任务上追上了原版的证据。
整个开源,何况无需依赖大限制的算力集群,在两张 H200 上就能完成磨真金不怕火。

DeepSeek-OCR 的操办想想是"靠视觉压缩一切",通过用极少的视觉 token 来暗示正本需要大量文本 token 的本色,以此镌汰大模子的谋略支拨,料理了大模子处理长文本的算力爆炸坚苦。
两东谈主小团队能在短时辰里复刻出中枢智商,若何作念到的?
更实用的复刻版
先来大要追溯一下 DeepSeek-OCR 为啥会大爆。
大模子处理长文本时,算力会随着序列长度呈二次方增长,几百页的文档就能把显存撑爆。
而 DeepSeek-OCR 想出了个反知识的解法——把翰墨渲染成图片,用视觉模态当压缩引子。
这么一来,正本要几千个文本 tokens 才智承载的本色,几百个视觉 tokens 就够了,压缩比能作念到 7-20 倍,何况10 倍压缩下准确率还能保持 97%。
也难怪它一开源就火了,还被称为" AI 的 JPEG 时刻"。

而两东谈主小团队复刻的中枢思谋也很明确,先把原版的逻辑架构精确收复。

DeepSeek-OCR 架构
DeepSeek-OCR 的灵魂就在于 DeepEncoder 编码器。在这部分上,团队严格革职原版操办,罗致「局部处理 - 压缩 - 全局露出」的三阶段串结合构。
第一步用 SAM-base 处理高差异率图像,把 1024 × 1024 的图切成 16 × 16 的补丁,靠窗口把稳力礼貌激活内存,就算生成 4096 个开首 token 也不会让显存过载;
然后用 16 × 卷积压缩器、两层 3 × 3 卷积把 4096 个 token 砍到 256 个,还把特征维度从 256 扩到 1024,为后续的全局把稳力减负;
终末用 CLIP-large 接办,但它不读原图,只处理压缩后的 256 个 tokens,靠密集全局把稳力执文档语义,避让了纯全局把稳力的内存爆炸问题。
复刻版还像原版相通,把 CLIP 的补丁特征和展平后的 SAM 特征拼接,输出 2048 维的交融特征。

不外,在解码器上,复刻版作念了个更求实的调遣,把原版激活参数为 570M 的DeepSeek-3B-MoE 换成了 Qwen2-7B-Instruct。
作念这个调遣倒不是本事收复不了,而是 Qwen2-7B-Instruct 和 VILA 磨真金不怕火框架兼容性更好,何况是整个开源的。
从后头的驱散上看,这个替换是合理的,中枢智商没丢,还镌汰了落地门槛。

在磨真金不怕火上,DeepOCR 的低算力友好特点体现得很较着。
罗致两阶段磨真金不怕火经由,且全程冻结 DeepEncoder(SAM+CLIP),这个操办就大幅镌汰了显存需求。
第一阶段仅磨真金不怕火多模态投影仪,冻结 DeepEncoder 与 LLM,罗致 512 的全局 batch size、1e-3 学习率,相助 AdamW 优化器与 ZeRO-3 卸载本事;
第二阶段是全模子预磨真金不怕火,磨真金不怕火多模态投影仪与 LLM,仍冻结 DeepEncoder,全局 batch size 降至 32,学习率调遣为 5e-5,同期开启梯度查验点进一步减少激活内存占用。
这套磨真金不怕火决议不错在 2 × H200 GPU 上跑通 ,照旧挺适配中小团队资源要求的。

再看实测数据,压缩效用上,DeepOCR 用约 250 个视觉 tokens,效用诚然稍失容于 DeepSeek-OCR Base 版,但 Qwen2.5-VL-7B 等基线 VLMs 需要 3949 个 token 才智达到雷同驱散。
这也印证了光学压缩逻辑的灵验性。
基础任务中,英文文本识别和表格剖释证据隆起,尤其表格剖释以至优于原版,这也收成于对原版 2D 空间编码的精确收复。

在 olmOCR 基准里,大要文档的基础 OCR 智商也很塌实,与原版证据接近。

天然,DeepOCR 和原版客不雅上的差距也有,但并不是架构没收复好,而是磨真金不怕火数据的限制。
团队暗示接下来会补没收式、多谈话、旧扫描件等数据,试试动态温度缩放、RLVR 这些本事,把复杂任务的差距再削弱。
两东谈主团队先容
Ming Liu 本科毕业于山东大学,专科是阁下物理。其后在北京大学拿到了物理硕士学位,现在在爱荷华州立大学攻读谋略机博士,议论聚焦于多模态界限。
曾在亚马逊担任阁下科学家实习生,从事 LLM 相关职责。

刘世隆在清华大学拿到了工学学士和谋略机博士学位,现为普林斯顿大学东谈主工智能实践室博士后议论员。议论界限在 LLM 智能体、多模态、谋略机视觉等方面。
在加入普林斯顿之前,他曾是字节 Seed 团队的科研东谈主员。还曾在英伟达、微软等公司实习过。

神气主页:
https://pkulium.github.io/DeepOCR_website/
代码地址:
https://github.com/pkulium/DeepOCR
一键三连「点赞」「转发」「防范心」
原谅在褒贬区留住你的主义!
— 完 —
� � 年度科技风向标「2025 东谈主工智能年度榜单」陈说行将于 11 月 17 日截止!点击了解确定
❤️� � 企业、家具、东谈主物 3 大维度,共建立了 5 类奖项,终末时刻所有冲刺� �
一键存眷 � � 点亮星标
科技前沿进展逐日见开云kaiyun.com
