TokenRouter 最近挂了个限时免费的 z-ai/glm-5.3-free。注册、建 Key、填客户端,几分钟就能跑通。限流 8 次/分钟,1M 上下文,不是永久免费,别当生产环境用。

这是什么

TokenRouter 是第三方聚合网关。这个带 -free 的不是智谱官方付费版,是网关自己搞的推广通道,走共享算力。

GLM-5.3 本体是智谱 2026 年 8 月发的旗舰模型,744B MoE,1M 上下文,官方价大概每百万 token $1.4 入 / $4.4 出。官方有自己的免费档(GLM-4.7-Flash、4.5-Flash),但 GLM-5.3 官方没做永久免费。所以这个通道随时可能改价,目前看着还是 0,具体哪天结束没人说。

当前状态:

  • 价格:$0(随时可能变)
  • 限流:8 次/分钟
  • 上下文:1M
  • SLA:没有
  • 稳定性:共享算力,高峰会排队,首 token 延迟偏高

适合学习、原型、轻量问答。连续跑 agent 或生产主链路就别了。用之前最好先看一眼模型页单价是不是还是 0。

注册和创建 Key

  1. 打开 tokenrouter.com,邮箱注册登录。
  2. 左侧点 API Keys → Create New Key。
  3. 名称随便写。
  4. Allowed Models 这里一定要手动输入并锁死 z-ai/glm-5.3-free(最关键的一步)。
  5. Unlimited Quota 打开。
  6. 创建后立刻复制 sk- 开头的 Key,关掉就看不到了。

三个必填参数

参数
Base URL https://api.tokenrouter.com/v1
API Key 你刚复制的 sk-xxx
Model Name z-ai/glm-5.3-free

常见翻车点:

  • 模型名少写了 z-ai/ 前缀 → 404 或模型不存在
  • 写成 glm-5.3-flash → 可能走付费通道
  • Base URL 末尾多加 /chat/completions → 客户端会再拼一次,直接 404
  • Key 没锁 Allowed Models,客户端下拉框选了付费模型 → 默默扣余额

代码示例

from openai import OpenAI
 
client = OpenAI(
api_key="sk-xxx",
base_url="https://api.tokenrouter.com/v1"
)
 
response = client.chat.completions.create(
model="z-ai/glm-5.3-free",
messages=[{"role": "user", "content": "用一句话解释什么是 MoE 架构"}],
max_tokens=512
)
 
print(response.choices[0].message.content)

只改 api_keybase_url,其他跟官方 OpenAI 一样。也支持 Anthropic 的 /v1/messages 格式。

限流了可以简单重试:

import time
import random
from openai import OpenAI, RateLimitError
 
client = OpenAI(api_key="sk-xxx", base_url="https://api.tokenrouter.com/v1")
 
def chat_with_retry(prompt, max_retries=3):
for i in range(max_retries):
try:
return client.chat.completions.create(
model="z-ai/glm-5.3-free",
messages=[{"role": "user", "content": prompt}]
).choices[0].message.content
except RateLimitError:
wait = (2 ** i) + random.uniform(0, 1)
print(f"限流了,{wait:.1f}s 后重试")
time.sleep(wait)
return None

常见客户端怎么接

Cherry Studio
设置 → 模型服务 → 添加自定义提供商。名称随便填,Base URL 和 Key 填上,模型名写 z-ai/glm-5.3-free,保存后刷新模型列表即可。

WorkBuddy
设置 → AI 提供商 → 添加自定义 OpenAI 兼容端点,三个参数填完设为默认。

Claude Code(CLI)

export ANTHROPIC_BASE_URL="https://api.tokenrouter.com/v1"
export ANTHROPIC_API_KEY="sk-xxx"

启动后在模型选择里指定 z-ai/glm-5.3-free

防止免费 Key 偷偷扣费

这是最容易踩的坑。

Key 没锁 Allowed Models,客户端又选了付费版 z-ai/glm-5.3,你还以为自己在用免费的,结果每一轮都在扣钱。

三件事一起做:

  1. 后台把 Allowed Models 直接锁死成 z-ai/glm-5.3-free
  2. 客户端模型名手动输入,别从下拉框选
  3. 隔段时间看一眼模型页单价,确认还是 $0

值不值得长期用

当白嫖通道可以,当基础设施不行。

模型能力本身不错,1M 上下文对长文档很友好。但共享算力、没 SLA、8 次/分钟限流,高峰会卡,连续 agent 任务很容易撞墙。数据还走第三方,敏感内容不建议。

更稳的免费替代是智谱官方的 GLM-4.5-Flash / 4.7-Flash,永久免费,有官方保障。

代码里可以做简单路由:优先走 TokenRouter 免费档,碰到 429 就自动切到本地 Ollama 或官方 Flash,保证任务不中断。

常见问题

和官方的 glm-5.3-flash 有什么区别?
这个是 TokenRouter 挂的限时满血版,能力强但随时可能收费、没官方 SLA。官方 flash 是轻量永久免费档,能力弱一点但更稳定。

填对了模型名还报 401?
检查 Key 是不是完整复制(以 sk- 开头),Base URL 有没有多余斜杠或路径。Key 被删或配额耗尽也会 401。

8 次/分钟够用吗?
日常问答和轻量测试够。连续 agent 任务(写代码 → 运行 → 调试那种)几秒就能打满,建议加重试逻辑或降低并发。

还有其他免费模型吗?
列表会变,去控制台看当前带 free 后缀的。同类聚合网关也有,但稳定性和合规性差别挺大。

现在还能用吗?
截至 2026-09-05 还是 $0,但没有截止公告。用之前确认一下单价就行。

接入时碰到 429、401 或者模型不存在,把报错贴出来我帮你看。