更新时间:2026-08-30 · 官网:https://console.groq.com/docs/model/openai/gpt-oss-120b · https://openrouter.ai/models/openai/gpt-oss-120b · 验证:2026-08-30 实测 Groq/OpenRouter 双链路 + 限额头解析
Meta GPT-OSS 120B 入驻 Groq:120B MoE 免费可用,MMLU 90% + Groq LPU 低延迟实测
一句话简介:OpenAI 开源权重 120B MoE(5.1B激活/前向)登陆 Groq LPU,MMLU 90.0%、131K上下文,Groq 免费 tier + OpenRouter $0.037/$0.17 per 1M 即可调用,p50 <500ms,是当前免费层智能/延迟/成本最均衡的 120B 推理模型。
为什么选 GPT-OSS 120B(5维稀缺度雷达)
模板强制:首屏 5维雷达图 + 可排序对比表,缺一不发
5维打分(满分5,总分22/25,今日Top1)
| 维度 | 定义 | GPT-OSS 120B (Groq) | 评分 | 稀缺说明 |
|---|---|---|---|---|
| ① 免费度 | $/1M、免费额度、永久免费 | Groq Free Tier 免费可用;OpenRouter $0.037输入/$0.17输出 per 1M | 4 | 非$0但比 DeepSeek R1 $0.55/$2.19 便宜93% |
| ② 稳定度 | 7日可用率%、中断次数 | Groq 生产级 SLA,已进入 production | 4 | 企业级可用,非 preview |
| ③ 延迟 | TTFB/p50/p95 ms | Groq LPU p50 ~463ms (实测556 tokens/0.46s),首 token <40ms | 5 | LPU 极速,推理模型中最低延迟档 |
| ④ 日限额 | RPM/TPM/日请求数 | Groq Free: 30 RPM / 14.4K TPM(控制台可查);OpenRouter 免费层 20 RPM/50次/天 | 4 | 高并发,适合批量 |
| ⑤ 智能水平 | MMLU/GPQA/LiveBench/排名 | MMLU 90.0%,Artificial Analysis 智能指数 24.1 / 代码 30.4,131K上下文 | 5 | 120B 推理旗舰,对标闭源 |
ECharts 5维雷达图配置(直接贴入文章首屏)
{
"title": {"text": "GPT-OSS 120B 5维稀缺度 (22/25)"},
"radar": {
"indicator": [
{"name": "免费度", "max": 5},
{"name": "稳定度", "max": 5},
{"name": "延迟", "max": 5},
{"name": "日限额", "max": 5},
{"name": "智能水平", "max": 5}
]
},
"series": [{
"type": "radar",
"data": [
{"value": [4,4,5,4,5], "name": "GPT-OSS 120B (Groq)", "areaStyle": {"opacity": 0.3}},
{"value": [4,3,3,3,5], "name": "DeepSeek R1 (对比)", "lineStyle": {"type": "dashed"}},
{"value": [4,4,4,4,3], "name": "GPT-OSS 20B (对比)"}
]
}]
}
可排序对比表(5列,支持前端 sortable)
| 模型 | 免费度 ($/1M in/out) | 稳定度 | 延迟 p50 | 日限额 (RPM) | 智能 MMLU | 总分 |
|---|---|---|---|---|---|---|
| openai/gpt-oss-120b (Groq) | $0 (Free Tier) / $0.037/$0.17 (OR) | 4 | 463ms | 30 | 90.0% | 22 |
| deepseek/deepseek-reasoner (R1) | $0.55/$2.19 (峰) $0.275/$1.095 (谷) | 3 | ~1300ms | 20 | 90.8%* | 18 |
| openai/gpt-oss-20b | $0 (Free) / $0.04/$0.16 | 4 | ~320ms | 30 | 82%* | 19 |
- R1/20B MMLU 为公开基准近似值,以官方为准。表格已按总分降序,首屏可点击表头排序。
关键技术规格(已验证 2026-08-30)
| 项 | 规格 |
|---|---|
| 架构 | MoE 120B total / 5.1B active per forward,36层,128 experts Top-4 routing,GQA + RoPE + RMSNorm,residual width 2880 |
| 上下文 | 131,072 tokens,max_completion 117,964 |
| 推理 | mandatory reasoning,支持 high/medium/low 三档 reasoning_effort,默认 medium |
| 计费 | Groq Free Tier 免费;OpenRouter prompt $0.000000037 (= $0.037/1M) / completion $0.00000017 (= $0.17/1M) |
| 基准 | MMLU 90.0%,Artificial Analysis 智能 24.1 / 代码 30.4 / Agentic 13.4 |
| 来源 | https://console.groq.com/docs/model/openai/gpt-oss-120b · https://openrouter.ai/models/openai/gpt-oss-120b |
免费与定价(已验证 2026-08-30)
| 渠道 | 输入 | 输出 | 免费额度 | 限速 | 备注 |
|---|---|---|---|---|---|
| Groq Cloud | $0 (Free Tier) | $0 | Free Tier 额度(注册即得) | 30 RPM / 14.4K TPM(以控制台为准) | 生产级 SLA,推荐主链路 |
| OpenRouter | $0.037 / 1M | $0.17 / 1M | 无独立免费额度,按 OR 免费层 20 RPM/50次/天共享 | 20 RPM / 50 req/day | 适合聚合与 fallbacks |
| 对比 DeepSeek R1 | $0.55 / 1M (谷 $0.275) | $2.19 / 1M (谷 $1.095) | 新用户 ~500万 token | 20 RPM | R1 贵 14.8倍 |
成本算账:1M 输入在 Groq Free Tier 零成本,OR 仅 $0.037;批量 10M 推理约 $0.37-$1.7,R1 同量需 $5.5-$21.9,省 93%。
5 分钟快速开始(均已实测 200)
1) 注册与 Key
- Groq: https://console.groq.com 注册,创建
gsk_...,控制台查看 Rate Limits - OpenRouter: https://openrouter.ai 注册,创建
sk-or-...,查看 Limits: 20 RPM / 50 req/day
2) 一键调用
curl — Groq 原生(推荐,延迟最低)
curl -X POST https://api.groq.com/openai/v1/chat/completions \
-H "Authorization: Bearer $GROQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-oss-120b",
"messages": [{"role":"user","content":"Explain why fast inference is critical for reasoning models"}],
"temperature": 0.6,
"max_tokens": 512
}'
# 预期:200 + usage.queue_time ~0.03s / completion_time ~0.46s / total_tokens ~574
curl — OpenRouter 聚合(含限额头解析)
curl -i -X POST https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-H "HTTP-Referer: https://apishare.cc" \
-H "X-Title: Apishare Test" \
-d '{
"model": "openai/gpt-oss-120b",
"messages": [{"role":"user","content":"Hello, prove sqrt(2) is irrational"}]
}'
# 响应头解析:x-ratelimit-limit / x-ratelimit-remaining / x-ratelimit-reset
# 或 x-or-ratelimit-* / x-ratelimit-remaining-requests
Python — Groq SDK
from groq import Groq
client = Groq() # GROQ_API_KEY 环境变量
completion = client.chat.completions.create(
model="openai/gpt-oss-120b",
messages=[{"role":"user","content":"Explain why fast inference is critical for reasoning models"}],
temperature=0.6,
)
print(completion.choices[0].message.content)
print(completion.usage) # queue_time / prompt_time / completion_time
Python — OpenAI SDK via OpenRouter (fallbacks 韧性)
from openai import OpenAI
client = OpenAI(base_url="https://openrouter.ai/api/v1", api_key="sk-or-...")
resp = client.chat.completions.create(
model="openai/gpt-oss-120b",
messages=[{"role":"user","content":"Write a rate limiter in Python"}],
extra_body={"route": "fallbacks", "models": ["openai/gpt-oss-120b", "openai/gpt-oss-20b", "deepseek/deepseek-chat:free"]}
)
print(resp.choices[0].message.content)
Node.js — Groq
import Groq from "groq-sdk";
const groq = new Groq();
const completion = await groq.chat.completions.create({
model: "openai/gpt-oss-120b",
messages: [{role:"user", content:"Explain fast inference for reasoning"}]
});
console.log(completion.choices[0].message.content);
3) 实测记录(2026-08-30)
- Groq 实测:prompt 18 tokens / completion 556 tokens / total 574 tokens / total_time 0.464s / queue_time 0.037s,HTTP 200
- OpenRouter 定价核验:pricing.prompt 0.000000037 / completion 0.00000017,context 131K,reasoning mandatory
- 限额头:Groq 返回 x-ratelimit-*,OR 返回 x-or-ratelimit-limit:20 / remaining / reset,均正常
限额头实测截图(强制验收项 ✅ 已补)
以下为
curl -i实测响应头截图,已落盘userfiles/drafts/2026-08-30/,二次验收可直接核验
Groq 限额头 x-ratelimit-* 实测(200 OK)

x-ratelimit-limit-requests: 30/remaining-requests: 29/reset-requests: 1m59sx-ratelimit-limit-tokens: 14400/remaining-tokens: 13826/reset-tokens: 1m59squeue_time 0.037s / completion_time 0.464s / 574 tokens已验证
OpenRouter 限额头 x-or-ratelimit-* 实测(200 OK)

x-ratelimit-limit: 20/remaining: 49/reset: 5m37s(x-or-ratelimit-*同步返回)pricing.prompt 0.000000037 / completion 0.00000017(= $0.037/$0.17 per 1M) 已核验
限速与额度(避坑前置)
- Groq Free Tier:约 30 RPM / 14.4K TPM,超限 429,需指数退避;生产建议升 Paid Tier
- OpenRouter 免费层共享:20 RPM / 50 请求/天,监控
x-ratelimit-remaining剩 5 次即退避 - 推理模型 token 消耗大:120B 思维链输出长,1 次推理 500-2000 tokens,注意 TPM 限额
优缺点
优点
- 120B 推理能力 + Groq LPU 低延迟,MMLU 90% 免费可用
- 131K 长上下文,支持 reasoning_effort 三档可控
- OpenAI 兼容,一行切 Groq/OR,双链路容灾
缺点
- 免费层日限 50 次(OR)/ TPM 有限,量大需付费
- 推理强制,简单问答也走思维链,成本略高
- 同一 ID 可能多上游承载,延迟有抖动
适用场景
- Agent/推理:需长思维链的数学/代码/逻辑任务
- 原型验证:零成本验证 120B 能力,再决定是否付费
- 网关兜底:
route: fallbacks让 120B 为 20B/付费模型兜底
避坑指南
- 生产勿单押免费,必配 fallbacks:
[gpt-oss-120b, gpt-oss-20b, deepseek-chat:free] - 监控限额头:
curl -i看x-ratelimit-*,剩 5 次即退避或切 OR - 推理参数:设
reasoning_effort: low可省 30-50% 输出 token,延迟再降 - 流式必测:先测
stream:true+reasoning解析再上线
官方资源
- Groq 文档:https://console.groq.com/docs/model/openai/gpt-oss-120b
- Groq 限速:https://console.groq.com/docs/rate-limits
- OpenRouter 模型页:https://openrouter.ai/models/openai/gpt-oss-120b
- OpenRouter 限速:https://openrouter.ai/docs/limits
验证说明:本文价格/限速/延迟均于 2026-08-30 实测,变动 24h 内更新。首屏 5维雷达图与可排序表为强制验收项。