硅基流动上线百度 PaddleOCR-VL-1.5,免费调用
一个歪七竖八的表格提取让人头疼,十份格式各异的文档解析让人崩溃。即便我们求助当前不少顶尖多模态大模型,也常常难以胜任这类繁琐的苦力活。
百度最新开源的 PaddleOCR-VL-1.5 为此带来了创新性突破。其异形框定位技术可从容应对文档解析的刁钻难题,准确率与可靠性实现大幅提升。
![]()
无论是扫描件的轻微倾斜、书本中缝导致的弯折变形,还是手机随手拍下的屏幕截图,都可以帮你真实还原文档的逻辑与板式结构。同时,新版本模型还新增了印章识别与文本检测识别能力。
弯折变形场景
![]()
印章识别
![]()
![]()
更进一步,新版本模型能深度理解长文档的内在结构:自动合并跨页表格,识别连贯的章节标题,让信息保持完整流畅。同时,其识别能力从古籍生僻字到包含中文、英文、藏文、孟加拉语等在内的 111 种语言,轻松胜任全球化、多语种的文档处理场景。
跨页表格识别
![]()
多语言识别
![]()
一如既往,PaddleOCR-VL-1.5 成功将高性能与高效率合二为一:仅凭 0.9B 的超轻参数,就在文档解析权威评测集 OmniDocBench v1.5 中实现了 94.5% 的顶尖精度,性能超越 Gemini-3 Pro 等通用多模态大模型。这还意味着,你无需为极高准确度承担庞大的算力成本。
![]()
作为登录硅基流动 AI 云的第 153 个模型,PaddleOCR-VL-1.5 可免费调用。这位高效的文档解析伙伴将帮助企业与用户以更低成本使用高性能文档解析能力,其卓越的精度与强大的适应性,直接转化为处理效率的倍增与人工复核工作量的锐减,切实提升工作效益。
![]()
你可通过 CLI 与 Python API 调用两种方式使用硅基流动服务。PaddleOCR-VL-1.5 使用教程:
https://docs.siliconflow.cn/cn/userguide/capabilities/multimodal-vision#6-paddleocr-客户端使用方法