Moondream 3.1 现已在 Workers AI 上可用
我们与 Moondream ↗ 合作,将其最新模型 @cf/moondream/moondream3.1-9B-A2B 引入 Workers AI。Moondream 3.1 是一款基于混合专家(mixture-of-experts)架构构建的快速视觉语言模型,总参数量为 9B,活跃参数量为 2B,可在保持快速、高性价比推理的同时提供前沿级别的视觉推理。
Moondream 3.1 专为实际视觉任务而设计,具备 32K token 上下文窗口,用于处理复杂查询和结构化输出。
- Query(查询) — 针对图像提出开放式问题,带有一个可选的推理参数
- Caption(描述) — 生成图像的简短、正常或长描述
- Point(指向) — 返回与目标词组匹配的对象坐标
- Detect(检测) — 返回与目标词组匹配的对象边界框
像实时摄像头馈送、机器人、内容审核和交互式智能体之类的视觉工作负载,需要毫秒级而不是秒级的响应。Moondream 3.1 较小的活跃占用(2B 活跃参数)与 Workers AI 的无服务器、全球分布式推理完美结合:请求可在靠近您用户的地方运行,且流式响应几乎可以立即开始返回 token。
在我们的测试中,首个 token 在大约 20–30 毫秒内流式返回,并且在每项任务中结果都非常迅速。以下示例端到端时间(客户端观察到的中位数,包括网络往返时间)是针对一张简单的、单一主体的图像。实际延迟很大程度上取决于图像以及您所要求的详细程度。
| 任务 | 端到端 (p50) |
|---|---|
query |
~770 ms |
caption |
~480 ms |
point |
~145 ms |
detect |
~160 ms |
在这样的速度下,您可以在处理请求时以内联方式调用模型,而无需将工作推送到后台队列或单独的服务。这开启了那些“如果响应缓慢就会破坏体验”的使用场景:在存储用户上传的图像前对其进行审核、在视频帧中定位对象以驱动实时叠加层、在提交表单时从文档中提取字段,或者让智能体在单轮内检查屏幕截图并决定其下一步操作。
通过 Workers AI 绑定(binding) (env.AI.run()) 或 /ai/run 处的 REST API 来使用 Moondream 3.1。您还可以在这些端点中搭配使用 AI Gateway。
欲了解更多信息,请参阅 Moondream 3.1 模型页面和定价。