用户测评|DeepSeek-OCR,你用了吗?
作者|Simon,硅基流动用户
我是 Simon,一个资深 asp.net 程序员,现在是一名独立的 AI 技术研发者,研发出多项 AI 应用于具体场景的技术,其中一项正在申请国家发明专利,已过初审。我会继续努力,争取有更大的进步。
OCR 模型我用过几款,也一直在关注,比如我有一个诉求是识别工业 CAD 图片,这是行业痛点之一,有一个具体场景是在图纸上高亮显示当前加工的工序,为后面的加工做提示。
DeepSeek-OCR 发布后,听说用了革命性的技术,就很好奇。
“要知道梨子的滋味,就得亲口尝一尝”
我写了一个页面用 WebAPI 调用硅基流动中这款模型,为了呈现效果也写了一些相关辅助的程序。先从最简单的有一些文字的图片开始,各种提示词都试试;然后尝试表格、图表的识别;再来几张照片看看模型能不能读懂;最后尝试在图上标注。咱一起看看 DeepSeek-OCR 的表现。
1. 识别图片上的文字,准确度高,速度特别快,速度这一点体验很赞。
![]()
2. 提取图表信息,表现也不错。
![]()
3. 这里有个小惊喜,我输入的原图是没有具体数据的,输出时模型给了估算值,第一次体验到这样的模型能力。
![]()
4. 这个场景大家可以用不同的提示词来试试,这个输出结果基本满足我的设想。
![]()
5. 这个提示词是:general: \nAnalyze the crop lodging situation in the image, identify the lodged areas, and estimate the percentage of affected area. 模型给出的回答让人看到了更大的想象空间。
![]()
体感总结
以上几个场景基本能让我们看到 DeepSeek-OCR 的能力,不过我在测试的过程中也有点过山车的感觉,满心期待开始,遇到问题很疑惑,各种尝试后又有小惊喜。
1. 很多时候我发现中文提示词不起效,返回的结果也不稳定,改为英文提示词就顺畅多了。硅基流动的同学也给我推荐了官方提供的常用提示词:
- General OCR: Free OCR.
- Markdown: <|grounding|>Convert the document to markdown.
- Table: <|grounding|>Extract all tables and convert to markdown format.
2. 模型幻觉还是有的,有时会回复与图片无关的回答。虽然返回结果有时不稳定,但有一种“大模型真正看懂图片了”的直观感受,通过优化提示词可以有真实的应用价值。
3. 图文等形式转成 Markdown 格式很实用,也方便后续还原文本和电子表格等。
4. 最让我感到惊艳的就是那张没有标值的图表,DeepSeek-OCR 能输出估算值。
5. 这款模型识别速度惊人,可能是我用过最快的 OCR 模型了。
6. 测评后,我自己后续想做的应用:开发一个工具一键还原图片中的文本或表格,还会把它用于图纸的识别场景。
DeepSeek-OCR 你用过了吗?也想听听你的使用心得。
上手体验 DeepSeek-OCR,硅基流动「限时免费」~
![]()