Skip to content

Qwen3.8 Flash

适用场景

Qwen3.8 Flash 适合对话、编程辅助、工具协作、长文档和图片理解。调用前在实时模型目录确认当前模型、能力与价格。

模型标识与能力

项目说明
Token Factory 模型 IDqwen3.8-flash
当前入口输入 / 输出文本、图片 / 文本
上游上下文1,000,000 token
上游最大输出131,072 token
当前入口最大输出128,000 token
思考模式支持思考与非思考,默认开启思考

阿里云于 2026-08-26 发布该模型。原厂还分别公布了普通模式和思考模式的输入限制,不能将完整上下文窗口理解为可同时输入和输出相同数量的 token。上游规格用于理解原厂能力;当前入口采用上表单独列出的输出上限,公开模型 ID 不代表锁定某个原厂托管快照。官方模型资料官方发布记录

调用方式

OpenAI Chat Completions 和 Anthropic Messages 两个入口均已验证普通请求、流式响应,以及工具调用和工具结果回传。图片理解也分别使用 PNG Base64 合成单图确认可用。

本模型当前不提供 Responses 生成或 Responses Compact。

快速开始准备 API Key 与账户余额,两种请求均设置 Content-Type: application/json

OpenAI Chat Completions

请求地址为 POST https://api.tokenfactory.cn/v1/chat/completions,鉴权头为 Authorization: Bearer <TOKENFACTORY_API_KEY>

json
{
  "model": "qwen3.8-flash",
  "max_tokens": 4096,
  "messages": [{ "role": "user", "content": "用三点说明如何为一个接口设计重试策略。" }],
  "stream": false
}

字段与响应格式见对话补全。配置 OpenAI 兼容客户端时,Base URL 为 https://api.tokenfactory.cn/v1

Anthropic Messages

请求地址为 POST https://api.tokenfactory.cn/anthropic/v1/messages,请求头为:

http
Content-Type: application/json
x-api-key: <TOKENFACTORY_API_KEY>
anthropic-version: 2023-06-01
json
{
  "model": "qwen3.8-flash",
  "max_tokens": 4096,
  "messages": [{ "role": "user", "content": "用三点说明如何为一个接口设计重试策略。" }],
  "stream": false
}

stream 改为 true 可使用流式响应,按 Anthropic 消息接口对话补全处理对应 SSE 事件。配置 Anthropic 兼容客户端时,Base URL 为 https://api.tokenfactory.cn/anthropic;工具配置步骤见兼容客户端配置

思考与工具调用

原厂 Qwen3.8 Flash 默认开启思考。Chat 的 reasoning_effort 可选 lowmediumxhigh,默认 xhigh;不要同时设置 reasoning_effortthinking_budget。这些模型扩展参数应按所选入口的实际支持情况使用。官方思考说明官方 Chat 参数

原厂默认保留历史思考;Chat 的历史 reasoning_content 应在同名字段完整回传,不拼接到 content,且会计入输入 token。工具结果回传时,保留完整的历史 assistant 消息,包括 reasoning_contenttool_calls,再追加对应的 role: "tool" 消息。Anthropic 则保留 thinkingtool_usetool_result 内容块,不混用两种消息格式。

使用工具时,让模型自动选择:Chat 设置 tool_choice: "auto",Anthropic 设置 tool_choice: {"type": "auto"}。原厂默认思考模式不支持通过指定函数名强制选择工具,请勿直接套用强制工具选择示例。官方工具调用说明

图片与接口边界

图片放在 user 消息的内容块数组中,图片宽度和高度都应大于 10 像素。两个入口均已使用 PNG Base64 单图确认可用,其他图片格式和外链图片尚未核验;当前不提供视频输入。图像理解返回文本,不等同于图像生成或编辑。官方视觉输入限制

Token Factory 未提供原厂 Files 生命周期,其他接口字段见对应 API 文档

OpenAI 图片请求

沿用前述 OpenAI 地址和鉴权,将 <BASE64_IMAGE_DATA> 替换为宽高均大于 10 像素的 PNG 图片 Base64 内容:

json
{
  "model": "qwen3.8-flash",
  "max_tokens": 4096,
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "描述这张图片中的主要内容。"
        },
        {
          "type": "image_url",
          "image_url": {
            "url": "data:image/png;base64,<BASE64_IMAGE_DATA>"
          }
        }
      ]
    }
  ],
  "stream": false
}

Anthropic 图片请求

沿用前述 Anthropic 地址和鉴权,使用同样满足尺寸要求的 PNG 图片。source.data 只放 Base64 内容,不包含 data:image/png;base64, 前缀:

json
{
  "model": "qwen3.8-flash",
  "max_tokens": 4096,
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "描述这张图片中的主要内容。"
        },
        {
          "type": "image",
          "source": {
            "type": "base64",
            "media_type": "image/png",
            "data": "<BASE64_IMAGE_DATA>"
          }
        }
      ]
    }
  ],
  "stream": false
}

价格与平台折扣

实时模型目录查看输入、缓存输入、输出单价及当前平台折扣。目录展示的是折扣后的最终单价,不要再次乘折扣。

原厂北京价目在完整上下文范围内采用一档价格,思考与非思考模式的单价相同;输出计量包含思维链和回答。旧版 Flash 的长度阶梯不能套用于本模型。官方价格说明

平台目录中的缓存输入单价仅用于缓存命中读取。当前缓存写入按普通输入单价计费,不采用原厂单独列出的显式缓存创建价格。请结合响应中的用量和计费说明核对账单。原厂缓存价格

变化与下架

  • 停用时间:以实时模型目录和正式变更说明为准。
  • 影响范围:本页对应 qwen3.8-flash,不将其他 Flash 版本视为等价替换。
  • 替代选项:从实时目录重新选择模型,复核输入模态、思考行为及价格。
  • 行动建议:模型不再返回时停止新请求,并通过本页查看迁移说明。

官方规格核验日期:2026-09-10。

Token Factory · 国产合规 AI Gateway