跳转到内容
搜索文档

更新日志

Cloudflare 的最新更新与改进。

Markdown 转换的纯文本输出

Markdown 转换服务现在支持一个新的 output 转换选项,用于控制转换后内容的格式。

output.format 设置为 text 以接收移除了 Markdown 语法的纯文本。默认值为 markdown,因此现有转换不受影响。

使用 env.AI 绑定(binding):

await env.AI.toMarkdown(
	{ name: "page.html", blob: new Blob([html]) },
	{
		conversionOptions: {
			output: { format: "text" },
		},
	},
);
await env.AI.toMarkdown(
	{ name: "page.html", blob: new Blob([html]) },
	{
		conversionOptions: {
			output: { format: "text" },
		},
	},
);

或者调用 REST API:

curl https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/tomarkdown \
  -H 'Authorization: Bearer {API_TOKEN}' \
  -F '[email protected]' \
  -F 'conversionOptions={"output": {"format": "text"}}'

当您请求文本输出时,每个结果的 format 字段会被设置为 text。有关更多详细信息,请参阅转换选项

Workers AI toMarkdown 和 AI Search 现在支持 GIF 和 BMP 图像转换

除了已支持的 JPEG、PNG、WebP 和 SVG 格式外,Workers AI Markdown 转换 (toMarkdown) 现在还支持 .gif.bmp 图像文件。

GIF 和 BMP 文件与其他格式运行相同的图像流水线。根据需要调整每张图像的大小(对于动态 GIF,仅使用第一帧),然后传递给目标检测模型以识别其包含的内容。这些检测到的目标会提示视觉模型编写图像的自然语言描述,该描述将变成可搜索、机器可读的 Markdown。

AI Search 会自动使用 toMarkdown 来处理它引入的文件,因此下一次您的索引同步时会自动包含任何 .gif.bmp 文件,无需更改任何配置。当您的内容混合了多种格式时,例如充满屏幕截图的支持知识库或 BMP 扫描件的存档,这将非常有用。

详细了解 Markdown 转换 以及 AI Search 支持的文件类型的完整列表。

Moondream 3.1 现已在 Workers AI 上可用

我们与 Moondream 合作,将其最新模型 @cf/moondream/moondream3.1-9B-A2B 引入 Workers AI。Moondream 3.1 是一款基于混合专家(mixture-of-experts)架构构建的快速视觉语言模型,总参数量为 9B,活跃参数量为 2B,可在保持快速、高性价比推理的同时提供前沿级别的视觉推理。

Moondream 3.1 专为实际视觉任务而设计,具备 32K token 上下文窗口,用于处理复杂查询和结构化输出。

关键能力

  • Query(查询) — 针对图像提出开放式问题,带有一个可选的推理参数
  • Caption(描述) — 生成图像的简短、正常或长描述
  • Point(指向) — 返回与目标词组匹配的对象坐标
  • Detect(检测) — 返回与目标词组匹配的对象边界框

边缘实时视觉

像实时摄像头馈送、机器人、内容审核和交互式智能体之类的视觉工作负载,需要毫秒级而不是秒级的响应。Moondream 3.1 较小的活跃占用(2B 活跃参数)与 Workers AI 的无服务器、全球分布式推理完美结合:请求可在靠近您用户的地方运行,且流式响应几乎可以立即开始返回 token。

在我们的测试中,首个 token 在大约 20–30 毫秒内流式返回,并且在每项任务中结果都非常迅速。以下示例端到端时间(客户端观察到的中位数,包括网络往返时间)是针对一张简单的、单一主体的图像。实际延迟很大程度上取决于图像以及您所要求的详细程度。

任务 端到端 (p50)
query ~770 ms
caption ~480 ms
point ~145 ms
detect ~160 ms

在这样的速度下,您可以在处理请求时以内联方式调用模型,而无需将工作推送到后台队列或单独的服务。这开启了那些“如果响应缓慢就会破坏体验”的使用场景:在存储用户上传的图像前对其进行审核、在视频帧中定位对象以驱动实时叠加层、在提交表单时从文档中提取字段,或者让智能体在单轮内检查屏幕截图并决定其下一步操作。

快速入门

通过 Workers AI 绑定(binding) (env.AI.run()) 或 /ai/run 处的 REST API 来使用 Moondream 3.1。您还可以在这些端点中搭配使用 AI Gateway

欲了解更多信息,请参阅 Moondream 3.1 模型页面定价

在 Workers AI 上推出 GLM-5.2

我们很高兴宣布在 Workers AI 上推出 GLM-5.2,这是 Z.ai 的旗舰代理(agentic)编码模型。

@cf/zai-org/glm-5.2 是一款专为代理型编码工作流构建的文本生成模型。凭借函数调用和推理支持,它可以处理长代码库、多步规划和工具增强型智能体。

关键特性和使用场景:

  • 代理编码:专为自主编码任务、长周期规划和复杂的软件工程工作流而设计
  • 大型上下文窗口:GLM-5.2 最多支持 1,048,576 个 token 的上下文窗口。Workers AI 推出该模型时提供 262,144 个 token 的上下文窗口,并计划在未来增加此限制
  • 函数调用:构建可在多个对话轮次中调用工具和 API 的智能体
  • 推理:解决复杂的问题求解和分步推理任务

通过 Workers AI 绑定(binding) (env.AI.run())、REST API /run/v1/chat/completions,或 AI Gateway 来使用 GLM-5.2。

定价可在模型页面定价页面上找到。

Moonshot AI Kimi K2.7 Code 现已在 Workers AI 上可用

@cf/moonshotai/kimi-k2.7-code 现已在 Workers AI 上可用。Kimi K2.7 Code 是 Kimi K2 系列中针对代码进行了优化的变体,基于混合专家(Mixture-of-Experts)架构构建,总参数量为 1T,每个 token 的活跃参数量为 32B。

改进的编码和智能体性能

K2.7 Code 在编码和智能体基准测试中相比 K2.6 实现了显著提升:

  • +21.8%,在 Kimi Code Bench v2 上
  • +11.0%,在 Program Bench 上
  • +31.5%,在 MLS Bench Lite 上

推理效率

K2.7 Code 与 K2.6 相比,使用的推理 token 减少了 30%,从而减少了“过度思考”并降低了重推理工作负载的推理成本。

关键能力

  • 262.1k token 上下文窗口,用于在长期运行的智能体任务中保留完整的对话历史记录、工具定义和代码库
  • 长周期编码,具有改进的指令遵循和更高的端到端编码任务成功率
  • 视觉输入,用于随文本一起处理图像
  • 可通过 chat_template_kwargs.thinking 配置推理深度的思维模式
  • 多轮工具调用,用于构建在多个对话轮次中调用工具的智能体
  • 支持 JSON schema 的结构化输出

与 Kimi K2.6 的区别

如果您正在从 Kimi K2.6 迁移,请注意以下几点:

  • K2.7 Code 针对编码任务进行了优化,具备改进的基准测试性能和推理效率
  • 缓存的输入 token 定价为每百万(M)token 0.19 美元(而 K2.6 为 0.16 美元)
  • API 使用方式完全相同 —— 无需更改参数

快速入门

通过 Workers AI 绑定(binding) (env.AI.run())、/ai/run 处的 REST API,或者 /v1/chat/completions 处的兼容 OpenAI 的端点来使用 Kimi K2.7 Code。您还可以在这些端点中搭配使用 AI Gateway

欲了解更多信息,请参阅 Kimi K2.7 Code 模型页面定价

Workers AI 上计划的模型弃用

我们正在更新 Workers AI 模型目录,以为新发布的版本让出空间。请在弃用日期之前更新您的应用程序,以移除对下列模型的引用。

推荐替代方案

有关定价,请参阅 Workers AI 定价页面

Kimi K2.5

我们最初表示 Kimi K2.5 将于 2026 年 5 月 10 日弃用,但我们已将弃用日期延长至 2026 年 5 月 30 日。请求将于 2026 年 5 月 30 日自动别名(aliased)到价格更高的 Kimi K2.6。请在 2026 年 5 月 30 日之前查看 @cf/moonshotai/kimi-k2.6 的定价和模型能力,以确保该模型满足您的需求。

于 2026 年 5 月 30 日弃用的模型

  • @cf/moonshotai/kimi-k2.5 --> @cf/moonshotai/kimi-k2.6
  • @hf/meta-llama/meta-llama-3-8b-instruct
  • @cf/meta/llama-3-8b-instruct
  • @cf/meta/llama-3-8b-instruct-awq
  • @cf/meta/llama-3.1-8b-instruct
  • @cf/meta/llama-3.1-8b-instruct-awq
  • @cf/meta/llama-3.1-70b-instruct
  • @cf/meta/llama-2-7b-chat-int8
  • @cf/meta/llama-2-7b-chat-fp16
  • @cf/mistral/mistral-7b-instruct-v0.1
  • @hf/mistral/mistral-7b-instruct-v0.2
  • @hf/google/gemma-7b-it
  • @cf/google/gemma-3-12b-it
  • @hf/nousresearch/hermes-2-pro-mistral-7b
  • @cf/microsoft/phi-2
  • @cf/defog/sqlcoder-7b-2
  • @cf/unum/uform-gen2-qwen-500m
  • @cf/facebook/bart-large-cnn

保持活跃的变体

模型的 -fast-lora 变体将保持活跃,包括:

  • @cf/meta/llama-3.3-70b-instruct-fp8-fast
  • @cf/meta/llama-3.1-8b-instruct-fast
  • @cf/google/gemma-7b-it-lora
  • @cf/google/gemma-2b-it-lora
  • @cf/mistral/mistral-7b-instruct-v0.2-lora
  • @cf/meta-llama/llama-2-7b-chat-hf-lora

LoRA 模型在未来可能会被弃用。我们将向目录中添加更多 LoRA 功能,并会在新的 LoRA 模型上线时进行沟通,以便在弃用旧模型之前给用户留出训练新 LoRA 的时间。

如需获取可用模型的完整列表,请参阅 Workers AI 模型目录