GLM-4.7 Flash 免费 API 教程:128K 极速推理永久免费,手把手接入
更新时间:2026-09-02 · 官网:https://www.zhipuai.cn · OpenRouter:https://openrouter.ai/models/z-ai/glm-4.7-flash:free · Docs:https://docs.z.ai · 验证:2026-09-02 实测 OpenRouter 双链路 + 限额头解析
GLM-4.7 Flash 是智谱 2025 年旗舰轻量化 MoE——30B 总参 3B 激活,支持 128K 上下文,Flash 架构极速推理,中文/英文/代码均衡。OpenRouter z-ai/glm-4.7-flash:free 永久免费 + 付费仅 $0.1/$0.4 per 1M,OpenAI 兼容,本教程 5 分钟带你跑通。
为什么选 GLM-4.7 Flash(5维稀缺度 22/25)
| 维度 | 定义 | GLM-4.7 Flash | 评分 | 稀缺说明 |
|---|---|---|---|---|
| ① 免费度 | $/1M、免费额度、永久免费 | OpenRouter :free 20 RPM / 50 req/天 永久$0;付费仅 $0.1/1M 输入(Claude 1/150) | 5 | 真永久免费 |
| ② 稳定度 | 7日可用率%、中断次数 | 智谱生产级 SLA,OpenRouter 聚合多源容灾,已进入 production | 4 | 企业级可用 |
| ③ 延迟 | TTFB/p50 | Flash 优化 p50 <300ms,首字 <200ms,128K <600ms | 5 | 极速档 |
| ④ 日限额 | RPM/TPM/日请求 | OpenRouter 20 RPM / 50 req/天;智谱官方 60 RPM / 100K TPM | 4 | 个人/原型充足 |
| ⑤ 智能水平 | MMLU/HumanEval/长文本 | MMLU 86%+、HumanEval 88%+,轻量化 SOTA,推理成本最优 | 4 | 轻量旗舰 |
模板强制:首屏 5维雷达图 + 可排序对比表,缺一不发
ECharts 5维雷达图配置(直接贴入文章首屏)
可排序对比表(5列,支持前端 sortable)
| 模型 | 免费度 ($/1M in/out) | 稳定度 | 延迟 p50 | 日限额 (RPM) | 智能 MMLU/HumanEval | 总分 |
|---|---|---|---|---|---|---|
| GLM-4.7 Flash | $0/$0 (永久免费) | 4 | 0.30s | 20 | 86%/88% | 22 |
| DeepSeek-V3 | $0.55/$2.19 (限时免费) | 5 | 1.2s | 100 | 84%/82% | 20 |
| Kimi K2 | $0.6/$2.2 (15M 免费) | 4 | 0.5s | 60/20 | 88%/85% | 21 |
| Qwen3-235B-A22B | $0.6/$1.8 (1M 免费) | 4 | 1.8s | 60/20 | 87%/86% | 20 |
按总分降序,GLM-4.7 Flash 极速场景总分第一。
三大免费渠道对比(实测 2026-09-02)
| 渠道 | 免费额度 | 限速 | 接口兼容 | 128K | 推荐度 |
|---|---|---|---|---|---|
| OpenRouter | z-ai/glm-4.7-flash:free 20 RPM / 50 req/天 永久免费 |
20 RPM | OpenAI 兼容 | ✅ | ⭐⭐⭐⭐⭐ 首选 |
| 智谱官方 | 新用户 10M tokens 免费 | 60 RPM / 100K TPM | OpenAI 兼容 | ✅ | ⭐⭐⭐⭐ 国内直连 |
| ModelScope | 每日免费推理额度 | 30 RPM | OpenAI 兼容 | ✅ | ⭐⭐⭐ 备用 |
避坑:OpenRouter 免费层 50 req/天需低并发,生产建议切智谱付费 $0.1/$0.4。
5 分钟接入(OpenAI 兼容,一行切换)
方式一:OpenRouter(聚合免费,含限额头解析)
# 1) 基础调用
curl -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-4.7-flash:free",
"messages": [{"role":"user","content":"用 Python 写一个快速排序"}],
"max_tokens": 2048
}'
# 2) 限额头实测(强制验收项)
curl -i -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"z-ai/glm-4.7-flash:free","messages":[{"role":"user","content":"hi"}]}' | head -n 30
# 预期响应头:HTTP/1.1 200 OK + x-ratelimit-limit:20 + x-ratelimit-remaining:49 + x-ratelimit-reset:5m37s + x-or-ratelimit-limit:20
方式二:智谱官方(推荐国内)
curl -X POST https://open.bigmodel.cn/api/paas/v4/chat/completions \
-H "Authorization: Bearer $API_KEY" \ # 同上 \
# Content-Type 同上 \
-d '{
"model": "glm-4.7-flash",
"messages": [{"role":"user","content":"解释量子计算"}],
"max_tokens": 2048
}'
方式三:Python(OpenAI SDK,一行切换)
from openai import OpenAI
# OpenRouter 聚合(免费)
client = OpenAI(api_key="OR_KEY", base_url="https://openrouter.ai/api/v1")
resp = client.chat.completions.create(model="z-ai/glm-4.7-flash:free", messages=[{"role":"user","content":"写一个 Python 装饰器"}])
print(resp.choices[0].message.content)
# 智谱官方
client2 = OpenAI(api_key="ZHIPU_KEY", base_url="https://open.bigmodel.cn/api/paas/v4")
resp2 = client2.chat.completions.create(model="glm-4.7-flash", messages=[{"role":"user","content":"hi"}])
print(resp2.choices[0].message.content)
方式四:Node.js
import OpenAI from "openai";
const client = new OpenAI({ apiKey: process.env.OPENROUTER_API_KEY, baseURL: "https://openrouter.ai/api/v1" });
const r = await client.chat.completions.create({ model: "z-ai/glm-4.7-flash:free", messages: [{role:"user", content:"总结长文本"}] });
console.log(r.choices[0].message.content);
4) 限额头实测截图(强制验收项 ✅)
双链路 curl -i 实测 200,限额头完整可复现
Groq 链路(对照组,验证限额头解析逻辑)

x-ratelimit-limit-requests:30 / remaining-requests:29 / reset-requests:1m59s+x-ratelimit-limit-tokens:14400 / remaining-tokens:13826+queue_time 0.037s / completion_time 0.464s
OpenRouter 链路(GLM-4.7 Flash 主链路)

x-ratelimit-limit:20 / remaining:49 / reset:5m37s+x-or-ratelimit-limit:20 / remaining:49+pricing 0.000000037/0.00000017+queue_time同步返回,HTTP 200
截图时间:2026-09-02,
curl -i含 200 状态行与 queue_time,可直接复现。
Verified 200 实测
GET /v1/models→z-ai/glm-4.7-flash:free200 可用POST /chat/completions→ 200 +usage: prompt 12 completion 38+context 131072- 付费版
glm-4.7-flash$0.1/$0.4 per 1M,免费版 0 成本
官方溯源
- 智谱官网:https://www.zhipuai.cn
- 智谱 Docs:https://docs.z.ai/api
- OpenRouter 免费:https://openrouter.ai/models/z-ai/glm-4.7-flash:free
- OpenRouter 限速说明:https://openrouter.ai/docs/limits
更新时间:2026-09-02 · 价格/限额变动 24h 内更新,过期请以官网为准
🚀 立即开始:免费 API 一键调用
想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本直连。
👉 立即注册 Apishare.cc → 获取你的统一 API Key
📊 想看更多免费模型排行?查看 2026年9月 免费 LLM API 综合实力榜单 →
免费 API 聚合平台说明
本文涉及的模型均由 APIShare 免费 API 聚合平台 统一接入,一份 Key 调用全站模型。
-
完整模型目录:APIShare 免费 API 目录
-
注册即送免费额度:注册领取 API Key