硅基流动 SiliconCloud 上线智谱 GLM-4.1V-9B-Thinking

模型上新
2025-07-04
作者:硅基流动

硅基流动 SiliconCloud 平台已上线智谱开源的 GLM-4.1V-9B-Thinking。该模型通过引入思维链推理机制,在回答准确性、内容丰富度与可解释性方面,整体性能达到 10B 级别视觉语言模型的领先水平,超越传统的非推理式视觉模型,推动视觉大模型从“看得见”走向“看得懂、想得通”。

SiliconCloud 平台的 GLM-4.1V-9B-Thinking 支持 64K 最大上下文长度。其中,Pro 版价格为输入 0.25 元 / M Tokens,输出为 1 元 / M Tokens,最高提供 1 万 RPM(一分钟最多允许的请求数) 与 500 万 TPM(一分钟最多允许的 Token 数)。用户可免费使用普通版,统一提供 1 千 RPM 与 5 万 TPM。

zhipu1.png
zhipu2.png

欢迎通过以下方式使用 GLM-4.1V-9B-Thinking。

在线体验

https://cloud.siliconflow.cn/models

第三方应用接入教程

https://docs.siliconflow.cn/cn/usercases/

开发者 API 文档

https://docs.siliconflow.cn/cn/api-reference/chat-completions/

模型效果

图像理解

zhipugif1.gif

图表识别

zhipugif2.gif

解数学题

zhipugif3.gif

模型能力及性能

GLM-4.1V-9B-Thinking 通过有效的混合训练融合了丰富的多模态模型能力,包括但不限于:

  • 视频理解:能够解析最长两小时的视频内容,通过推理对视频中的时间、人物、事件和逻辑关系进行准确分析;

  • 图像问答:对图像中的内容进行深入分析和解答,具备较强的逻辑能力和世界知识;

  • 学科解题:支持对数学、物理、生物、化学等学科问题的看图解题,通过推理给出详细的思考过程;

  • 文字识别:对图片和视频中的文字和图表内容进行准确抽取和结构化输出;

  • 文档解读:对金融、政务、教育等领域的文档内容进行准确的原生理解、抽取、提炼和问答;

  • Grounding:识别图片中的特定区域并抽取坐标位置,支持各种需要定位信息的下游任务;

  • GUI Agent:识别网页、电脑屏幕、手机屏幕等交互界面元素,支持点击、滑动等指令执行能力;

  • 代码生成:能够基于输入的图片文字内容自动编写前端代码,看图写网页。

根据智谱官方发布的基准测试数据,GLM-4.1V-9B-Thinking 在 28 项评测任务中有 23 项达到 10B 级别模型最佳。

zhipushuju.jpg

现在,你可以通过调用 SiliconCloud 平台的 API 使用 GLM-4.1V-9B-Thinking 模型了。

相关资讯

硅基流动 SiliconCloud 上线月之暗面 Kimi K2

模型上新
2025-07-14

首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务!

模型上新
2025-02-01

硅基流动 SiliconCloud 上线 Qwen3-Embedding & Reranker 系列模型

模型上新
2025-06-24