09-02更新,据官方平台发布,DeepSeek V4 Flash 和 Vision Exp 的免费期到 9 月 3 日 17:00(新加坡时间) 就停。之后按官方峰谷价再打折:工作日 9–12 点、14–18 点是官方价五折;其余时间和周末再打一层,相当于官方高峰价的 2.5 折。

想继续白嫖的话,平台推 GLM 5.3 Flash(就是前一阵那个 Ox Alpha)。320B 总参、18B 激活,原生多模态,1M 上下文。Qwen3.8 Flash、Hy3、MiMo V2.5 也还免费。

09-02官方免费模型调整
09-02官方免费模型调整

2026-08-29,提供更多免费模型

🎁 http://B.AI 免费模型阵容全线就位,全部 $0 零门槛使用!

无论你是高频开发者还是日常 AI 深度用户,http://B.AI 都为你准备了零门槛的强力模型选单!

🔥 社区首选:GLM-5.3-Flash
前段时间爆火的神秘模型“Ox Alpha”揭晓!作为 GLM-5 系列首款原生全模态模型,拥有 320B 总参数/18B 激活,采用稀疏+线性注意力混合架构与 1M 上下文。响应极速、推理强大,是目前综合体验与高频调用的不二之选!

📋 全量免费模型阵容一览:

🔹 GLM-5.3-Flash:320B 原生全模态,1M 上下文,极致性价比首选
🔹 Qwen3.8-Flash:125B MoE 架构,GDN+QSA 混合注意力,性能超越 Qwen3.7-Plus
🔹 DeepSeek-V4-Flash:284B/13B 稀疏 MoE,1M 上下文,推理直逼 V4-Pro
🔹 DeepSeek-V4-Flash-Vision-Exp:1M 上下文,支持图文混合输入,多模态 Agent 体验拉满
🔹 Hy3(腾讯混元):295B 稀疏 MoE,快慢思考融合,Agent 性能比肩旗舰
🔹 MiMo-V2.5(小米):310B 稀疏 MoE,原生多模态,支持文/图/音/视全能输入

b.ai最新免费模型
b.ai最新免费模型

2026-08-17 起,DeepSeek 官方 API 对 deepseek-v4-flashdeepseek-v4-pro 启用峰谷计价,基础单价同步上调。不过 B.AI 对 deepseek-v4-flash 限时免费使用,覆盖 Web Chat 与 OpenAI 兼容 API。

DeepSeek V4 官方价格策略

高峰时段:09:00–12:00、14:00–18:00,空闲时段为上述时段外,价格减半。

模型 缓存命中输入 缓存未命中输入 输出
V4-Flash 高峰 0.10 3.0 9.0
V4-Flash 空闲 0.05 1.5 4.5
V4-Pro 高峰 0.30 9.0 27.0
V4-Pro 空闲 0.15 4.5 13.5

对照 5 月的价格,高峰缓存命中输入涨幅 1100%,输出涨幅 350%,对于“勤俭持家”的你,估计接受不了,所以赶紧薅 B.AI 的羊毛吧。

B.AI 是什么

B.AI 是第三方聚合网关,不是 DeepSeek 官方渠道。其 2026-08-17 公告将 deepseek-v4-flash 调整为免费,不过你得需要点魔法才能访问。

限时免费
限时免费

技术规格对齐官方开源版:

  • 284B 总参 / 13B 激活 MoE,MIT License
  • 1M 上下文,384K 最大输出
  • 支持 tool_calls、JSON output、非思考/思考切换

免费为"限时",平台未给结束时间,反正可以薅羊毛就对了,Google 邮箱可直接登录,然后创建 key 即可。

B.AI OpenAI 兼容接入

  • Base URLhttps://api.b.ai/v1
  • AuthAuthorization: Bearer sk-xxx
  • 模型名deepseek-v4-flash

cURL

curl https://api.b.ai/v1/chat/completions \
-H "Authorization: Bearer $BAI_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}],"max_tokens":256}'

使用 curl 通了之后就可以直接到 cc-switch 配置好,codex 就可以正常访问了。

codex成功调用
codex成功调用

常见问题

使用 deepseek 在 codex 使用可能会遇到下面的错误:

{"error":{"message":"The `reasoning_content` in the thinking mode must be passed back to the
API.","type":"invalid_request_error","param":"","code":"invalid_request_error"}}

我们需要将 model_reasoning_effort 设置为 none 即可。

model_reasoning_effort = "none"