近日,ocr技术领域迎来了爆发期,各类先进模型层出不穷,如百度的paddleocr-vl、阿里的qwen3-vl、小红书推出的dots-ocr,以及nanonets发布的ocr2等。其中,deepseek发布了题为《deepseek-ocr:基于视觉压缩的大模型长上下文增强方案》的研究论文,并同步开源了其模型权重。
DeepSeek-OCR的核心包含两大部分:一是纯粹的OCR能力,这也是本次实测的重点
;二是“上下文光学压缩”(Contexts Optical Compression)技术,该技术有效缓解了大模型在处理长文本时面临的算力瓶颈问题。这项创新让AI在处理视觉信息时更接近人类的记忆机制,可能成为通向下一代智能的关键路径。通过视觉压缩实现“以小博大”,DeepSeek-OCR在长文档处理中实现了精度与效率的新平衡,甚至获得了Andrej Karpathy的高度评价。
在OCR性能方面,DeepSeek-OCR表现亮眼。当压缩比≤10倍时,识别准确率超过95%,几乎无损。在ICDAR 2025数据集上,10倍压缩下准确率达到97.3%,处理速度达8.2页/秒,仅占用4.5GB显存。相较之下,MinerU2.0每页输出约6000+ tokens,速度仅为1.5页/秒,显存消耗高达12.8GB,明显处于劣势。实际应用场景中,该模型处理286页年报表格还原率达95.7%,耗时仅4分钟;论文中的公式识别率达到92.1%,生成的LaTeX代码可直接使用;合同批注关联识别率达到89.5%,比Tesseract高出27个百分点。
接下来进入具体测试环节。由于未进行本地部署,测试采用了Hugging Face平台上由用户khang119966搭建的Gradio演示空间(https://www.php.cn/link/9a2df0715e604dc5b670a2ffcc67dbc7 2.5 Pro)进行LaTeX公式识别对比时所用的案例。当时因DeepSeek尚不支持多模态,未能参与评测,此次正好补全这一空缺。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
例1为中高难度模糊手写公式,数字采用欧洲书写习惯,例如7中间带横线,且有一个8极似6。此前测试中仅Gemini 2.5 Pro成功识别,而DeepSeek-OCR与其他多数模型一样,将模糊的8误判为6,且输出中夹杂一段异常字符串,需手动删除后方可正常解析。百度PaddleOCR同样将8识别为6,未能正确还原。
例2为简单印刷体公式,任务较为基础,DeepSeek-OCR与其他主流模型均能顺利完成识别。
例3涉及多个复杂公式的批量识别,DeepSeek-OCR整体完成尚可,但存在明显瑕疵:中间插入了非预期符号,且缺乏合理换行,影响阅读和后续使用;相比之下,百度PaddleOCR处理得更为整洁规范。
Clips AI
自动将长视频或音频内容转换为社交媒体短片
255
查看详情
例4为包含矩阵运算的高阶公式,DeepSeek-OCR表现良好,结构还原准确,LaTeX语法正确。
例5是最高难度的手写混合场景——公式嵌入段落文本中,且手写横线与笔记本原装横线重叠干扰,仅Gemini 2.5 Pro成功识别,DeepSeek-OCR结果较差,未能有效分离内容。此外,在复杂表格识别任务中,DeepSeek-OCR未能准确提取表头信息,而百度PaddleOCR-VL表现出色。值得注意的是,测试过程中使用的HF Space稳定性欠佳,常无法同时加载不同模型的结果,限制了横向对比的完整性。
综合来看,DeepSeek-OCR确实展现了强大的技术潜力和创新价值,尤其在长上下文处理与视觉压缩方面的突破值得肯定。然而就当前OCR任务的实际表现而言,它尚未达到SOTA水平。需要强调的是,这并非否定其优秀——其架构设计理念极具前瞻性——但在上述几个测试实例中,其OCR能力确实略逊于百度PaddleOCR-VL这款参数量仅0.9B的小型模型。
另外,在实际应用中,DeepSeek-OCR将PDF转换为Markdown的速度极为出色,22页文档不到一分钟即可完成,但返回格式为JSON,正文内容冗长,缺乏可视化预览,查阅不便。同时,模型并未对插图进行语义理解,其他功能则基本达标。
以上就是实测!DeepSeek最新开源OCR模型,多数场景竟不如百度Paddle的详细内容,更多请关注其它相关文章!
# 率达到
# 福建全网营销推广概念
# 铜川关键词seo排名
# 日照网站优化简历照片
# 京东关键词排名怎么预估
# 宁波网站建设必备知识
# 长沙搜狗网站推广软件
# 高校建设网站
# 推广都有什么网站吗
# 美团网站的推广方式
# 香河县网站优化
# 如何写
# 转换为
# 显存
# 怎么做
# 会议纪要
# deepseek
# 小红
# 开源
# 文档
# 的是
# 大模型
# claude
# gpt-4
# 百度
# gpt
# 小红书
# pdf
# ai
# json
# markdown
# js
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
“五年内人类程序员将消失”预言引争议,AI真的那么强大了吗?
视觉中国推出AI灵感绘图功能
深度学习模型综述:用于3D MRI和CT扫描的应用
苹果头显降临,AI虚拟人的救星还是流星?
学生作文评分的新趋势:教师与AI的合作模式
谷歌旗下 DeepMind 开发出 RoboCat AI 模型,能控制多种机器人执行一系列任务
AI智能室内效果图设计软件效果,确实惊到我了!
西班牙小鲜肉*视频在网上疯传,本人发文澄清:是AI换脸的假视频!
微软 Azure AI 文本转语音服务升级:新增男性声音和扩展语言支持
华为云天筹AI求解器荣获世界人工智能大会最高奖
禁止艺术家使用 AI 创作《龙与地下城》游戏插图的决定已在 D&D Beyond 生效
金山办公宣布与英伟达团队合作,加速WPS AI服务
可按用户语气自动回复消息,Zoom 推出基于生成式 AI 的新功能
Meta发布语音AI模型 Voicebox 助虚拟助手与NPC对话
XREAL Beam 投屏盒子正式发布:支持“可悬停 AR 空间屏”
传字节内测对话式 AI 产品,代号「Grace」;马斯克嘲讽苹果 头显;比亚迪 F 品牌定名「方程豹」
Xbox游戏工作室负责人:VR/AR领域的用户规模还不足够
央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天
科普:什么是AI大模型
特斯拉 Optimus 人形机器人入驻北美门店,帮助提升汽车销量
实测 AI 建筑设计软件的自动生成效果图能力
人工智能和神经网络有什么联系与区别?
从医疗康复外骨骼到通用人形机器人,傅利叶智能推动核心技术升级
WHEE安装教程
这款在《自然通讯》发表的机器人,为变形金刚来到现实创造可能性
谷歌将使用公开信息训练 AI 模型,构建更强大的自家产品
云南首例达芬奇机器人微创心脏手术成功开展
一家 380 亿美元的数据巨头,要掀起企业「AI 化」革命
中国气象局预测:到 2030 年,中国人工智能气象应用将达到国际领先水平
参考封面|人工智能“淘金热”
无人机自主巡检为高海拔输电线路运维添“新彩”
第四范式「式说」大模型入选《2025年通用人工智能创新应用案例集》
“思享荟”沙龙热议AIGC与元宇宙 复旦大学赵星畅谈深度数字化
如何利用物联网技术提高企业生产线智能化水平,提升生产效率
2025年贵州省青少年机器人竞赛在安举行
Meta 为打造元宇宙不惜下血本:VR 开发者年薪高达百万美元
城市在采用人工智能方面进展如何?
【首发】首款“消化内镜手术机器人”进入临床尾声,ROBO医疗获数千万元A轮融资
AI 模型 Stable Diffusion 升级:正常生成五指、图像更逼真
微软在 Build 大会上宣布的新 Microsoft Store AI Hub 现已开始推出
马斯克的幽默“现实”:AR眼镜与20美元“增强现实”哪个真实?
昆仑万维与全球领先的元宇宙公司Meta达成商务合作,共同认可昆仑万维在XR领域的技术实力
AI绘画,还需要懂数学?
微软Xbox称VR和AR还需要时间 先玩大的
农业产业升级:AI驱动的“崃·见田”开启农田未来展望
亚马逊确认今年不举办re:MARS人工智能大会
首个算网生态体!中国移动元宇宙产业联盟正式成立
灯塔AI大模型票房预测上线:开源算法不断提升精准度
微软新出热乎论文:Transformer扩展到10亿token
研究表明 GPT-4 模型具备自我纠错能力,有望推动 AI 代码进一步商业化
2025-11-11
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。