Groq 免费 LLM API - 超低延迟推理

Groq Free LLM API - Ultra-Low Latency Inference

Groq 提供 13 个免费 LLM 模型,30 RPM,LPU 架构实现亚 100 毫秒延迟。包含对话、音频和审核模型。

Groq 免费 API 详情

实测于 2026-08-23 00:30 +08:00(来源:oneapi 生产 DB Channel 表直读) 渠道 slug: | 详情页 URL:


1. 渠道介绍

Groq 是一家开创性的 AI 基础设施公司,使用定制 LPU(语言处理单元)架构实现超低延迟推理。免费层提供 6 个对话模型、4 个音频模型(Whisper + Orpheus)和 3 个内容审核模型,速率限制宽松(30 RPM)。非常适合需要即时响应的开发者。


2. 实测支持模型列表

口径:models_total = 13(Channel.models 全量直读);chat = 6;audio = 4;embedding = 0;moderation = 3

对话模型(6 个)

  • allam-2-7b
  • groq/compound
  • groq/compound-mini
  • openai/gpt-oss-120b
  • openai/gpt-oss-20b
  • qwen/qwen3.6-27b

音频模型(4 个)

  • canopylabs/orpheus-arabic-saudi
  • canopylabs/orpheus-v1-english
  • whisper-large-v3
  • whisper-large-v3-turbo

审核模型(3 个)

  • meta-llama/llama-prompt-guard-2-22m
  • meta-llama/llama-prompt-guard-2-86m
  • openai/gpt-oss-safeguard-20b

3. 注册方法

待定


4. 使用方法

Base URL:

待定


5. 实测数据

待 it 基准实测 JSON 到料后填充。每数据点标注「实测于 YYYY-MM-DD HH:MM」。

指标 值 备注
HTTP 状态码 待填 实测 /models 端点
首 token 延迟 待填 ms
完整响应时间 待填 ms
TPS 待填 tokens/sec
RPM 限制 待填 429 实测门槛
TPM 限制 待填 429 实测门槛
日调用上限 待填 429 实测门槛

6. 优缺点总结

优点:

  • LPU 架构提供亚 100 毫秒延迟
  • 免费层 30 RPM 额度宽松
  • 多样化模型组合:对话、音频、审核

缺点:

  • 音频模型可能需要单独激活
  • 专用审核模型不适用于通用对话

本页由内容维护员于 2026-08-25 生成,数据以 oneapi 权威 JSON 为准。


🚀 立即开始:免费 API 一键调用

想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本直连。

👉 立即注册 Apishare.cc → 获取你的统一 API Key

📊 想看更多免费模型排行?查看 2026年9月 免费 LLM API 综合实力榜单 →


立即上手:APIShare 免费 API 目录


免费 API 聚合平台说明

本文涉及的模型均由 APIShare 免费 API 聚合平台 统一接入,一份 Key 调用全站模型。