硅基流动上线 DeepSeek-OCR,限时免费

模型上新
平台活动
2025-10-27
作者:硅基流动

如果说传统 OCR 是一个字一个字“抄写”文档内容,那深度求索最新开源的 3B 模型 DeepSeek-OCR 就像开启了“视觉速读”模式。它不再逐字符识别文本,而是把整页文字当成一幅图像来理解,用高效的“视觉 Token”替代传统的“文本 Token”。

640.png

这种“以视觉承载语言”的思路,使其在保持 97% 以上高精度的同时,实现了惊人的效率飞跃,在多项测试中以最少 Token 数达到顶尖性能。
原本一页 A4 纸内容需要约 1000 个 Token 才能表达,现在仅用 100 个视觉 Token 就能搞定,压缩比超过 10 倍,做到了性能更强、输入更短、推理更快,“既瘦身又不失真”。

640-1.png

更重要的是,DeepSeek-OCR 的视野远不止于文字。作为一个为高效视觉-文本压缩而设计的视觉语言模型,它还具备通用理解能力。
无论是近百种语言的识别,还是对图表、几何图形、化学公式乃至自然图像的深度解析,它都能通过一个统一的提示词轻松应对,展现出超越传统 OCR 的灵活性与智能。

文本转换为 Markdown

640.gif

图表转换为 Markdown

640 (1).gif

这个“又快、又准、又省”的视觉理解助手已成为登陆硅基流动的第 145 个模型。限时免费 API 调用已开放,现在即可体验它的高效与便捷。

640 (1).png

调用 DeepSeek-OCR 时,我们推荐官方提供的常用提示词:

  • General OCR: Free OCR.
  • Markdown: <|grounding|>Convert the document to markdown.
  • Table: <|grounding|>Extract all tables and convert to markdown format.
相关资讯

硅基流动 SiliconCloud 上线智谱 GLM-4.1V-9B-Thinking

模型上新
2025-07-04

硅基流动 SiliconCloud 上线月之暗面 Kimi K2

模型上新
2025-07-14

首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务!

模型上新
2025-02-01