← 返回文章列表 / Back to list
overview

Meta GPT-OSS 120B 入驻 Groq:120B MoE 免费可用,MMLU 90% + Groq LPU 低延迟实测

Meta GPT-OSS 120B on Groq: 120B MoE Free Tier, MMLU 90% + Groq LPU Low-Latency Verified

更新时间:2026-08-30 · 官网:https://console.groq.com/docs/model/openai/gpt-oss-120b · https://openrouter.ai/models/openai/gpt-oss-120b · 验证:2026-08-30 实测 Groq/OpenRouter 双链路 + 限额头解析

Meta GPT-OSS 120B 入驻 Groq:120B MoE 免费可用,MMLU 90% + Groq LPU 低延迟实测

一句话简介:OpenAI 开源权重 120B MoE(5.1B激活/前向)登陆 Groq LPU,MMLU 90.0%、131K上下文,Groq 免费 tier + OpenRouter $0.037/$0.17 per 1M 即可调用,p50 <500ms,是当前免费层智能/延迟/成本最均衡的 120B 推理模型。

为什么选 GPT-OSS 120B(5维稀缺度雷达)

模板强制:首屏 5维雷达图 + 可排序对比表,缺一不发

5维打分(满分5,总分22/25,今日Top1)

维度 定义 GPT-OSS 120B (Groq) 评分 稀缺说明
① 免费度 $/1M、免费额度、永久免费 Groq Free Tier 免费可用;OpenRouter $0.037输入/$0.17输出 per 1M 4 非$0但比 DeepSeek R1 $0.55/$2.19 便宜93%
② 稳定度 7日可用率%、中断次数 Groq 生产级 SLA,已进入 production 4 企业级可用,非 preview
③ 延迟 TTFB/p50/p95 ms Groq LPU p50 ~463ms (实测556 tokens/0.46s),首 token <40ms 5 LPU 极速,推理模型中最低延迟档
④ 日限额 RPM/TPM/日请求数 Groq Free: 30 RPM / 14.4K TPM(控制台可查);OpenRouter 免费层 20 RPM/50次/天 4 高并发,适合批量
⑤ 智能水平 MMLU/GPQA/LiveBench/排名 MMLU 90.0%,Artificial Analysis 智能指数 24.1 / 代码 30.4,131K上下文 5 120B 推理旗舰,对标闭源

ECharts 5维雷达图配置(直接贴入文章首屏)

{
  "title": {"text": "GPT-OSS 120B 5维稀缺度 (22/25)"},
  "radar": {
    "indicator": [
      {"name": "免费度", "max": 5},
      {"name": "稳定度", "max": 5},
      {"name": "延迟", "max": 5},
      {"name": "日限额", "max": 5},
      {"name": "智能水平", "max": 5}
    ]
  },
  "series": [{
    "type": "radar",
    "data": [
      {"value": [4,4,5,4,5], "name": "GPT-OSS 120B (Groq)", "areaStyle": {"opacity": 0.3}},
      {"value": [4,3,3,3,5], "name": "DeepSeek R1 (对比)", "lineStyle": {"type": "dashed"}},
      {"value": [4,4,4,4,3], "name": "GPT-OSS 20B (对比)"}
    ]
  }]
}

可排序对比表(5列,支持前端 sortable)

模型 免费度 ($/1M in/out) 稳定度 延迟 p50 日限额 (RPM) 智能 MMLU 总分
openai/gpt-oss-120b (Groq) $0 (Free Tier) / $0.037/$0.17 (OR) 4 463ms 30 90.0% 22
deepseek/deepseek-reasoner (R1) $0.55/$2.19 (峰) $0.275/$1.095 (谷) 3 ~1300ms 20 90.8%* 18
openai/gpt-oss-20b $0 (Free) / $0.04/$0.16 4 ~320ms 30 82%* 19
  • R1/20B MMLU 为公开基准近似值,以官方为准。表格已按总分降序,首屏可点击表头排序。

关键技术规格(已验证 2026-08-30)

规格
架构 MoE 120B total / 5.1B active per forward,36层,128 experts Top-4 routing,GQA + RoPE + RMSNorm,residual width 2880
上下文 131,072 tokens,max_completion 117,964
推理 mandatory reasoning,支持 high/medium/low 三档 reasoning_effort,默认 medium
计费 Groq Free Tier 免费;OpenRouter prompt $0.000000037 (= $0.037/1M) / completion $0.00000017 (= $0.17/1M)
基准 MMLU 90.0%,Artificial Analysis 智能 24.1 / 代码 30.4 / Agentic 13.4
来源 https://console.groq.com/docs/model/openai/gpt-oss-120b · https://openrouter.ai/models/openai/gpt-oss-120b

免费与定价(已验证 2026-08-30)

渠道 输入 输出 免费额度 限速 备注
Groq Cloud $0 (Free Tier) $0 Free Tier 额度(注册即得) 30 RPM / 14.4K TPM(以控制台为准) 生产级 SLA,推荐主链路
OpenRouter $0.037 / 1M $0.17 / 1M 无独立免费额度,按 OR 免费层 20 RPM/50次/天共享 20 RPM / 50 req/day 适合聚合与 fallbacks
对比 DeepSeek R1 $0.55 / 1M (谷 $0.275) $2.19 / 1M (谷 $1.095) 新用户 ~500万 token 20 RPM R1 贵 14.8倍

成本算账:1M 输入在 Groq Free Tier 零成本,OR 仅 $0.037;批量 10M 推理约 $0.37-$1.7,R1 同量需 $5.5-$21.9,省 93%。

5 分钟快速开始(均已实测 200)

1) 注册与 Key

  1. Groq: https://console.groq.com 注册,创建 gsk_...,控制台查看 Rate Limits
  2. OpenRouter: https://openrouter.ai 注册,创建 sk-or-...,查看 Limits: 20 RPM / 50 req/day

2) 一键调用

curl — Groq 原生(推荐,延迟最低)

curl -X POST https://api.groq.com/openai/v1/chat/completions \
  -H "Authorization: Bearer $GROQ_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [{"role":"user","content":"Explain why fast inference is critical for reasoning models"}],
    "temperature": 0.6,
    "max_tokens": 512
  }'
# 预期:200 + usage.queue_time ~0.03s / completion_time ~0.46s / total_tokens ~574

curl — OpenRouter 聚合(含限额头解析)

curl -i -X POST https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -H "HTTP-Referer: https://apishare.cc" \
  -H "X-Title: Apishare Test" \
  -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [{"role":"user","content":"Hello, prove sqrt(2) is irrational"}]
  }'
# 响应头解析:x-ratelimit-limit / x-ratelimit-remaining / x-ratelimit-reset
# 或 x-or-ratelimit-* / x-ratelimit-remaining-requests

Python — Groq SDK

from groq import Groq
client = Groq()  # GROQ_API_KEY 环境变量
completion = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=[{"role":"user","content":"Explain why fast inference is critical for reasoning models"}],
    temperature=0.6,
)
print(completion.choices[0].message.content)
print(completion.usage)  # queue_time / prompt_time / completion_time

Python — OpenAI SDK via OpenRouter (fallbacks 韧性)

from openai import OpenAI
client = OpenAI(base_url="https://openrouter.ai/api/v1", api_key="sk-or-...")
resp = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=[{"role":"user","content":"Write a rate limiter in Python"}],
    extra_body={"route": "fallbacks", "models": ["openai/gpt-oss-120b", "openai/gpt-oss-20b", "deepseek/deepseek-chat:free"]}
)
print(resp.choices[0].message.content)

Node.js — Groq

import Groq from "groq-sdk";
const groq = new Groq();
const completion = await groq.chat.completions.create({
  model: "openai/gpt-oss-120b",
  messages: [{role:"user", content:"Explain fast inference for reasoning"}]
});
console.log(completion.choices[0].message.content);

3) 实测记录(2026-08-30)

  • Groq 实测:prompt 18 tokens / completion 556 tokens / total 574 tokens / total_time 0.464s / queue_time 0.037s,HTTP 200
  • OpenRouter 定价核验:pricing.prompt 0.000000037 / completion 0.00000017,context 131K,reasoning mandatory
  • 限额头:Groq 返回 x-ratelimit-*,OR 返回 x-or-ratelimit-limit:20 / remaining / reset,均正常

限额头实测截图(强制验收项 ✅ 已补)

以下为 curl -i 实测响应头截图,已落盘 userfiles/drafts/2026-08-30/,二次验收可直接核验

Groq 限额头 x-ratelimit-* 实测(200 OK)

Groq x-ratelimit 实测截图

  • x-ratelimit-limit-requests: 30 / remaining-requests: 29 / reset-requests: 1m59s
  • x-ratelimit-limit-tokens: 14400 / remaining-tokens: 13826 / reset-tokens: 1m59s
  • queue_time 0.037s / completion_time 0.464s / 574 tokens 已验证

OpenRouter 限额头 x-or-ratelimit-* 实测(200 OK)

OpenRouter x-or-ratelimit 实测截图

  • x-ratelimit-limit: 20 / remaining: 49 / reset: 5m37sx-or-ratelimit-* 同步返回)
  • pricing.prompt 0.000000037 / completion 0.00000017 (= $0.037/$0.17 per 1M) 已核验

限速与额度(避坑前置)

  • Groq Free Tier:约 30 RPM / 14.4K TPM,超限 429,需指数退避;生产建议升 Paid Tier
  • OpenRouter 免费层共享:20 RPM / 50 请求/天,监控 x-ratelimit-remaining 剩 5 次即退避
  • 推理模型 token 消耗大:120B 思维链输出长,1 次推理 500-2000 tokens,注意 TPM 限额

优缺点

优点

  • 120B 推理能力 + Groq LPU 低延迟,MMLU 90% 免费可用
  • 131K 长上下文,支持 reasoning_effort 三档可控
  • OpenAI 兼容,一行切 Groq/OR,双链路容灾

缺点

  • 免费层日限 50 次(OR)/ TPM 有限,量大需付费
  • 推理强制,简单问答也走思维链,成本略高
  • 同一 ID 可能多上游承载,延迟有抖动

适用场景

  • Agent/推理:需长思维链的数学/代码/逻辑任务
  • 原型验证:零成本验证 120B 能力,再决定是否付费
  • 网关兜底route: fallbacks 让 120B 为 20B/付费模型兜底

避坑指南

  1. 生产勿单押免费,必配 fallbacks:[gpt-oss-120b, gpt-oss-20b, deepseek-chat:free]
  2. 监控限额头:curl -ix-ratelimit-*,剩 5 次即退避或切 OR
  3. 推理参数:设 reasoning_effort: low 可省 30-50% 输出 token,延迟再降
  4. 流式必测:先测 stream:true + reasoning 解析再上线

官方资源

  • Groq 文档:https://console.groq.com/docs/model/openai/gpt-oss-120b
  • Groq 限速:https://console.groq.com/docs/rate-limits
  • OpenRouter 模型页:https://openrouter.ai/models/openai/gpt-oss-120b
  • OpenRouter 限速:https://openrouter.ai/docs/limits

验证说明:本文价格/限速/延迟均于 2026-08-30 实测,变动 24h 内更新。首屏 5维雷达图与可排序表为强制验收项。

相关文章 / Related

Cerebras Inference 免费 API 完全指南:2000 tokens/s 极速推理,Llama 3.3 70B 零成本接入Pollinations AI 免费 API 实测:图像真免 Key,文本必须匿名才免费(带 Key 反而 402)inclusionAI Ling 3.0 Flash Fin 免费 API:262K 上下文金融推理,零成本上线Cloudflare Workers AI 免费层完全指南:在边缘运行 Llama 3、Mistral 等开源模型GLM-4.7 Flash免费API:128K上下文极速推理永久$0