TokenRouter 最近挂了个限时免费的 z-ai/glm-5.3-free。注册、建 Key、填客户端,几分钟就能跑通。限流 8 次/分钟,1M 上下文,不是永久免费,别当生产环境用。
这是什么
TokenRouter 是第三方聚合网关。这个带 -free 的不是智谱官方付费版,是网关自己搞的推广通道,走共享算力。
GLM-5.3 本体是智谱 2026 年 8 月发的旗舰模型,744B MoE,1M 上下文,官方价大概每百万 token $1.4 入 / $4.4 出。官方有自己的免费档(GLM-4.7-Flash、4.5-Flash),但 GLM-5.3 官方没做永久免费。所以这个通道随时可能改价,目前看着还是 0,具体哪天结束没人说。
当前状态:
- 价格:$0(随时可能变)
- 限流:8 次/分钟
- 上下文:1M
- SLA:没有
- 稳定性:共享算力,高峰会排队,首 token 延迟偏高
适合学习、原型、轻量问答。连续跑 agent 或生产主链路就别了。用之前最好先看一眼模型页单价是不是还是 0。
注册和创建 Key
- 打开 tokenrouter.com,邮箱注册登录。
- 左侧点 API Keys → Create New Key。
- 名称随便写。
- Allowed Models 这里一定要手动输入并锁死
z-ai/glm-5.3-free(最关键的一步)。 - Unlimited Quota 打开。
- 创建后立刻复制
sk-开头的 Key,关掉就看不到了。
三个必填参数
| 参数 | 值 |
|---|---|
| Base URL | https://api.tokenrouter.com/v1 |
| API Key | 你刚复制的 sk-xxx |
| Model Name | z-ai/glm-5.3-free |
常见翻车点:
- 模型名少写了
z-ai/前缀 → 404 或模型不存在 - 写成
glm-5.3-flash→ 可能走付费通道 - Base URL 末尾多加
/chat/completions→ 客户端会再拼一次,直接 404 - Key 没锁 Allowed Models,客户端下拉框选了付费模型 → 默默扣余额
代码示例
from openai import OpenAI client = OpenAI( api_key="sk-xxx", base_url="https://api.tokenrouter.com/v1") response = client.chat.completions.create( model="z-ai/glm-5.3-free", messages=[{"role": "user", "content": "用一句话解释什么是 MoE 架构"}], max_tokens=512) print(response.choices[0].message.content)
只改 api_key 和 base_url,其他跟官方 OpenAI 一样。也支持 Anthropic 的 /v1/messages 格式。
限流了可以简单重试:
import timeimport randomfrom openai import OpenAI, RateLimitError client = OpenAI(api_key="sk-xxx", base_url="https://api.tokenrouter.com/v1") def chat_with_retry(prompt, max_retries=3): for i in range(max_retries): try: return client.chat.completions.create( model="z-ai/glm-5.3-free", messages=[{"role": "user", "content": prompt}] ).choices[0].message.content except RateLimitError: wait = (2 ** i) + random.uniform(0, 1) print(f"限流了,{wait:.1f}s 后重试") time.sleep(wait) return None
常见客户端怎么接
Cherry Studio
设置 → 模型服务 → 添加自定义提供商。名称随便填,Base URL 和 Key 填上,模型名写 z-ai/glm-5.3-free,保存后刷新模型列表即可。
WorkBuddy
设置 → AI 提供商 → 添加自定义 OpenAI 兼容端点,三个参数填完设为默认。
Claude Code(CLI)
export ANTHROPIC_BASE_URL="https://api.tokenrouter.com/v1"export ANTHROPIC_API_KEY="sk-xxx"
启动后在模型选择里指定 z-ai/glm-5.3-free。
防止免费 Key 偷偷扣费
这是最容易踩的坑。
Key 没锁 Allowed Models,客户端又选了付费版 z-ai/glm-5.3,你还以为自己在用免费的,结果每一轮都在扣钱。
三件事一起做:
- 后台把 Allowed Models 直接锁死成
z-ai/glm-5.3-free - 客户端模型名手动输入,别从下拉框选
- 隔段时间看一眼模型页单价,确认还是 $0
值不值得长期用
当白嫖通道可以,当基础设施不行。
模型能力本身不错,1M 上下文对长文档很友好。但共享算力、没 SLA、8 次/分钟限流,高峰会卡,连续 agent 任务很容易撞墙。数据还走第三方,敏感内容不建议。
更稳的免费替代是智谱官方的 GLM-4.5-Flash / 4.7-Flash,永久免费,有官方保障。
代码里可以做简单路由:优先走 TokenRouter 免费档,碰到 429 就自动切到本地 Ollama 或官方 Flash,保证任务不中断。
常见问题
和官方的 glm-5.3-flash 有什么区别?
这个是 TokenRouter 挂的限时满血版,能力强但随时可能收费、没官方 SLA。官方 flash 是轻量永久免费档,能力弱一点但更稳定。
填对了模型名还报 401?
检查 Key 是不是完整复制(以 sk- 开头),Base URL 有没有多余斜杠或路径。Key 被删或配额耗尽也会 401。
8 次/分钟够用吗?
日常问答和轻量测试够。连续 agent 任务(写代码 → 运行 → 调试那种)几秒就能打满,建议加重试逻辑或降低并发。
还有其他免费模型吗?
列表会变,去控制台看当前带 free 后缀的。同类聚合网关也有,但稳定性和合规性差别挺大。
现在还能用吗?
截至 2026-09-05 还是 $0,但没有截止公告。用之前确认一下单价就行。
接入时碰到 429、401 或者模型不存在,把报错贴出来我帮你看。
评论