← 返回文章列表 / Back to list
overview

Groq 免费极速推理 API:13 个免费模型实测盘点

Groq Free Ultra-Fast Inference API: 13 Free Models Tested

引言

Groq 以自研 LPU 芯片闻名,单卡每秒可输出数百 token,是 2026 年延迟最低的推理云之一。本文基于 APIShare 渠道池(https://api.groq.com/openai/v1)于 2026-08-22 的逐一实测,共收录 13 个免费模型11 个实测验证可用——6 个对话模型进入主榜,5 个专项能力模型单独隔离展示;另 2 个 Orpheus TTS 待 Groq 条款激活。所有模型走 OpenAI 兼容端点统一调用。

主榜:对话模型(6 个 · chat-completions 实测通过)

模型 ID 上下文 最大输出 特性 适用场景
openai/gpt-oss-120b 128K 64K 推理链 / 工具调用 / 结构化输出 复杂推理、Agent 大脑首选
openai/gpt-oss-20b 128K 64K 推理链 / 工具调用 高频调用性价比之王
qwen/qwen3.6-27b 128K 16K 图片输入 / 工具 / 推理 图文多模态、中英双语
groq/compound 128K 8K Agentic 系统(自动检索聚合) 需要联网查证的问答
groq/compound-mini 128K 8K Agentic 轻量版 低成本自动化流水线
allam-2-7b 4K 4K json_mode 阿拉伯语场景专项

⚠️ reasoning 注意事项gpt-oss 系列与 qwen3.6 会先生成思维链,思考内容同样消耗输出额度。请将 max_tokens 设为 ≥256,否则会出现"只见思考、不见回答"的空回复。

专项能力模型(7 个 · 不参与对话主榜评分)

模型 ID 能力类型 说明
whisper-large-v3-turbo 语音→文字 速度优先,推荐默认
whisper-large-v3 语音→文字 精度优先
canopylabs/orpheus-v1-english 文字→语音 英语 TTS · 即将上线*
canopylabs/orpheus-arabic-saudi 文字→语音 阿拉伯语 TTS · 即将上线*
openai/gpt-oss-safeguard-20b 内容安全分类 输出侧安全审查
meta-llama/llama-prompt-guard-2-86m 输入安全审查 返回风险概率分
meta-llama/llama-prompt-guard-2-22m 输入安全审查 更轻量的概率打分

* 即将上线:需 Groq 组织管理员在控制台接受模型条款后激活,当前调用会返回 model_terms_required 错误。其余 11 个模型均已实测 HTTP 200 可用。

调用示例

from openai import OpenAI

client = OpenAI(base_url="https://api.groq.com/openai/v1", api_key="gsk_...")
resp = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=[{"role": "user", "content": "用一句话解释 LPU 为什么快"}],
    max_tokens=512)
print(resp.choices[0].message.content)

速率与最佳实践

  • 免费层常见限流约 30 RPM / 14400 RPD,突发并发触发 429 时请加令牌桶退避重试。
  • 免费层数据可能用于服务改进,敏感业务数据慎用。
  • 迁移提示:旧的 llama-3.x 系列(llama-3.1-8b-instantllama-3.3-70b-versatile 等)已不在当前渠道池内,历史代码请迁移至 openai/gpt-oss-20bgroq/compound-mini
  • 通过 GET /openai/v1/models 可随时获取实时清单;APIShare 统一端点已同步以上模型清单,11 个开箱即用,2 个 Orpheus TTS 待激活后开放。

相关文章 / Related

免费 AI 编程智能体 Freebuff:零成本调用前沿大模型免费视频生成 API 盘点免费大模型 API 总览:聊天、绘图、语音OpenRouter 免费模型清单免费图像生成 API 盘点