我们把发票流水线指向 Qwen3 VL 30B A3B Instruct API,OCR 加 JSON 抽取一周内替换了两个独立服务。
Qwen3 VL 30B A3B Instruct 是阿里 Qwen 出品的 MoE 视觉语言模型,30B 总参数、约 3B 激活,一次调用同时读图与文本,OCR 与图表理解都很强。在 VibeToken 上通过兼容 OpenAI 的端点提供,输入 ¥0.17 / 1M、输出 ¥0.595 / 1M,比标准价低 15%。
Qwen3 VL 30B A3B Instruct API —— 视觉语言 MoE,3B 激活
Qwen3 VL 30B A3B Instruct API 运行一个 30B 总参数、约 3B 激活的专家混合视觉语言模型,一次调用同时读图与文本。
Qwen3 VL 30B A3B Instruct API 提供 Alibaba Qwen3 VL 30B A3B Instruct,一个专家混合视觉语言模型:总参数 300 亿,每个 token 只激活约 30 亿,因此以小模型的延迟与成本,获得接近大网络的稳定感知质量。截图、照片、扫描件、图表与示意图作为标准 image_url 内容块,与提示词一起放进 messages 数组,模型在一次请求里读取图文并以文本作答;Qwen3 VL 30B A3B Instruct API 兼容任意 OpenAI 客户端,无需改动代码,一把密钥即可覆盖整个目录,长文档与多图问题也能在同一次调用里处理。
该模型面向真实的视觉工作做了指令微调、直接作答:照片、票据与扫描件的 OCR 文字提取、文档与图表理解、界面截图分析、视觉定位与多图推理。Qwen3 VL 30B A3B Instruct API 计费为每百万输入 token ¥0.17、每百万输出 token ¥0.595,比 ¥0.20 / ¥0.70 的标价低 15%,按 token 计费,无每请求费。流式输出与标准 OpenAI 模式的工具调用,让你把 Qwen3 VL 30B A3B Instruct API 接进文档流水线或 GUI 智能体,而无需编写厂商专属的胶水代码,成本与延迟在扩容时保持稳定。
Qwen3 VL 30B A3B Instruct API 给你什么
以 3B 激活的成本拿到视觉语言质量。
图文同输入
Qwen3 VL 30B A3B Instruct API 在同一个请求里接收图像与文本,截图、照片、扫描件、图表与示意图和你的提示词一起放进 messages 数组。
MoE、3B 激活
30B 总参数的专家混合网络每个 token 只激活约 3B,因此 Qwen3 VL 30B A3B Instruct API 以小模型的延迟与成本给出大模型的感知。
OCR 与文档
对照片、扫描件与文档页面的强文字识别,让 Qwen3 VL 30B A3B Instruct API 成为票据解析、表单读取与文档抽取的可靠底座。
图表、界面与定位
模型能读图表与表格、理解应用截图与 GUI、在场景中定位物体,因此 Qwen3 VL 30B A3B Instruct API 适合先看后动的智能体。
工具与 JSON
以标准 OpenAI 模式返回函数调用与结构化 JSON,该 API 适配多模态智能体与数据流水线。
流式、按 token
随生成流式返回 token,按 token 计费,输入 ¥0.17、输出 ¥0.595,比标价低 15%,无请求费。

三步完成对 Qwen3 VL 30B A3B Instruct API 的首次调用
接一次线,之后随意流式。
创建密钥
一把 VibeToken 密钥即可访问 Qwen3 VL 30B A3B Instruct API 及目录里的每个模型,没有厂商专属的东西要配置。
指向客户端
把任意 OpenAI 客户端发往 vibetoken.cn/v1,model=qwen/qwen3-vl-30b-a3b-instruct,messages 数组里混合文本与 image_url 内容块;Qwen3 VL 30B A3B Instruct API 在同样的 chat-completions 形态上作答。
流式并盯用量
模型随生成流式返回 token,并按响应返回 token 用量,因此每次调用 Qwen3 VL 30B A3B Instruct API 的成本与延迟都可见。
按使用量付费
VibeToken 透传合作方价格,与模型官方公开 API 价格对比。
按使用量付费
VibeToken 透传合作方价格,与模型官方公开 API 价格对比。
| 分辨率 | VibeToken | 官方 | 节省 |
|---|---|---|---|
| Input (per 1M) | ¥0.170 | −15% | |
| Output (per 1M) | ¥0.595 | −15% |
本次请求费用 ¥0.170(Input (per 1M))。¥1 大约可以调用本模型 5 次。
官方价 = Alibaba Qwen 对 Qwen3 VL 30B A3B Instruct 的标价(每百万输入 ¥0.20、每百万输出 ¥0.70)。VibeToken 以 ¥0.17 / ¥0.595 提供 Qwen3 VL 30B A3B Instruct API,比标价低 15%。
正在基于 Qwen3 VL 30B A3B Instruct API 构建的团队
截图、扫描件与照片同在一次调用背后。
3B 激活参数让 Qwen3 VL 30B A3B Instruct API 回答截图问题比我们之前的稠密 VL 模型更快,成本只是零头。
标准 image_url 内容块意味着我们的多模态栈第一天就跑在 Qwen3 VL 30B A3B Instruct API 上,零自定义管道。
输入 ¥0.17、输出 ¥0.595,Qwen3 VL 30B A3B Instruct API 让按页文档分析便宜到每次上传都能跑。
从该 API 流式很顺,我们的聊天 UI 逐 token 渲染关于图像的回答。
我们把图表截图发给 Qwen3 VL 30B A3B Instruct API,数字每次都以干净的结构化 JSON 返回。
我们的 GUI 智能体通过 Qwen3 VL 30B A3B Instruct API 读取应用界面,稳定定位要点击的按钮。
从另一家切到 Qwen3 VL 30B A3B Instruct API 只改了一个字符串——OpenAI 形态完全没动。
多语言 OCR 正是我们统一到 Qwen3 VL 30B A3B Instruct API 的原因;葡萄牙语票据和英语一样解析得干净。
Qwen3 VL 30B A3B Instruct API —— 常见问题
把流量导过来之前该知道的。
它是 VibeToken 对 Alibaba Qwen3 VL 30B A3B Instruct 的托管接入——一个 30B 总参数、约 3B 激活的专家混合视觉语言模型,通过兼容 OpenAI 的端点提供。