用户测评|DeepSeek-OCR,你用了吗?

用户测评
2025-10-31
作者:硅基流动

作者|Simon,硅基流动用户

我是 Simon,一个资深 asp.net 程序员,现在是一名独立的 AI 技术研发者,研发出多项 AI 应用于具体场景的技术,其中一项正在申请国家发明专利,已过初审。我会继续努力,争取有更大的进步。

OCR 模型我用过几款,也一直在关注,比如我有一个诉求是识别工业 CAD 图片,这是行业痛点之一,有一个具体场景是在图纸上高亮显示当前加工的工序,为后面的加工做提示。

DeepSeek-OCR 发布后,听说用了革命性的技术,就很好奇。

“要知道梨子的滋味,就得亲口尝一尝”

我写了一个页面用 WebAPI 调用硅基流动中这款模型,为了呈现效果也写了一些相关辅助的程序。先从最简单的有一些文字的图片开始,各种提示词都试试;然后尝试表格、图表的识别;再来几张照片看看模型能不能读懂;最后尝试在图上标注。咱一起看看 DeepSeek-OCR 的表现。

1. 识别图片上的文字,准确度高,速度特别快,速度这一点体验很赞。

640.png

2. 提取图表信息,表现也不错。

640-1.png

3. 这里有个小惊喜,我输入的原图是没有具体数据的,输出时模型给了估算值,第一次体验到这样的模型能力。

640-2.png

4. 这个场景大家可以用不同的提示词来试试,这个输出结果基本满足我的设想。

640-3.png

5. 这个提示词是:general: \nAnalyze the crop lodging situation in the image, identify the lodged areas, and estimate the percentage of affected area. 模型给出的回答让人看到了更大的想象空间。

640.jpg

体感总结

以上几个场景基本能让我们看到 DeepSeek-OCR 的能力,不过我在测试的过程中也有点过山车的感觉,满心期待开始,遇到问题很疑惑,各种尝试后又有小惊喜。

1. 很多时候我发现中文提示词不起效,返回的结果也不稳定,改为英文提示词就顺畅多了。硅基流动的同学也给我推荐了官方提供的常用提示词:

  • General OCR: Free OCR.
  • Markdown: <|grounding|>Convert the document to markdown.
  • Table: <|grounding|>Extract all tables and convert to markdown format.

2. 模型幻觉还是有的,有时会回复与图片无关的回答。虽然返回结果有时不稳定,但有一种“大模型真正看懂图片了”的直观感受,通过优化提示词可以有真实的应用价值。

3. 图文等形式转成 Markdown 格式很实用,也方便后续还原文本和电子表格等。

4. 最让我感到惊艳的就是那张没有标值的图表,DeepSeek-OCR 能输出估算值。

5. 这款模型识别速度惊人,可能是我用过最快的 OCR 模型了。

6. 测评后,我自己后续想做的应用:开发一个工具一键还原图片中的文本或表格,还会把它用于图纸的识别场景。

DeepSeek-OCR 你用过了吗?也想听听你的使用心得。

上手体验 DeepSeek-OCR,硅基流动「限时免费」~

640-2.jpg