硅基流动 SiliconCloud 上线智谱 GLM-4.1V-9B-Thinking
硅基流动 SiliconCloud 平台已上线智谱开源的 GLM-4.1V-9B-Thinking。该模型通过引入思维链推理机制,在回答准确性、内容丰富度与可解释性方面,整体性能达到 10B 级别视觉语言模型的领先水平,超越传统的非推理式视觉模型,推动视觉大模型从“看得见”走向“看得懂、想得通”。
SiliconCloud 平台的 GLM-4.1V-9B-Thinking 支持 64K 最大上下文长度。其中,Pro 版价格为输入 0.25 元 / M Tokens,输出为 1 元 / M Tokens,最高提供 1 万 RPM(一分钟最多允许的请求数) 与 500 万 TPM(一分钟最多允许的 Token 数)。用户可免费使用普通版,统一提供 1 千 RPM 与 5 万 TPM。
![]()
![]()
欢迎通过以下方式使用 GLM-4.1V-9B-Thinking。
在线体验
https://cloud.siliconflow.cn/models
第三方应用接入教程
https://docs.siliconflow.cn/cn/usercases/
开发者 API 文档
https://docs.siliconflow.cn/cn/api-reference/chat-completions/
模型效果
图像理解
![]()
图表识别
![]()
解数学题
![]()
模型能力及性能
GLM-4.1V-9B-Thinking 通过有效的混合训练融合了丰富的多模态模型能力,包括但不限于:
-
视频理解:能够解析最长两小时的视频内容,通过推理对视频中的时间、人物、事件和逻辑关系进行准确分析;
-
图像问答:对图像中的内容进行深入分析和解答,具备较强的逻辑能力和世界知识;
-
学科解题:支持对数学、物理、生物、化学等学科问题的看图解题,通过推理给出详细的思考过程;
-
文字识别:对图片和视频中的文字和图表内容进行准确抽取和结构化输出;
-
文档解读:对金融、政务、教育等领域的文档内容进行准确的原生理解、抽取、提炼和问答;
-
Grounding:识别图片中的特定区域并抽取坐标位置,支持各种需要定位信息的下游任务;
-
GUI Agent:识别网页、电脑屏幕、手机屏幕等交互界面元素,支持点击、滑动等指令执行能力;
-
代码生成:能够基于输入的图片文字内容自动编写前端代码,看图写网页。
根据智谱官方发布的基准测试数据,GLM-4.1V-9B-Thinking 在 28 项评测任务中有 23 项达到 10B 级别模型最佳。
![]()
现在,你可以通过调用 SiliconCloud 平台的 API 使用 GLM-4.1V-9B-Thinking 模型了。