← 返回文章列表 / Back to list
overview

NVIDIA NIM 免费推理端点

NVIDIA NIM Free Inference Endpoints

⚠️ 待更新·2026-08-29核验 · 更新时间待核验 · 本文信息可能已过期,请以官方文档为准 更新时间:2026-08-29 · 核验状态:待更新 · 官方溯源待补

引言

NVIDIA NIM 把主流开源模型打包成标准化推理容器并提供云端托管端点。注册 build.nvidia.com 可获 1000 credits 免费额度,覆盖数十个模型。

可用模型与端点

端点:https://integrate.api.nvidia.com/v1/chat/completions(OpenAI 兼容)。

  • meta/llama-3.1-405b-instruct
  • meta/llama-3.1-70b-instruct
  • nvidia/llama-3.1-nemotron-70b-instruct
  • mistralai/mistral-nemo-12b-instruct
  • qwen/qwen2.5-7b-instruct
  • deepseek-ai/deepseek-r1

调用示例

from openai import OpenAI
client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-...")
resp = client.chat.completions.create(
    model="deepseek-ai/deepseek-r1",
    messages=[{"role": "user", "content": "用 Python 实现快速排序"}],
    temperature=0.6, max_tokens=1024)
print(resp.choices[0].message.content)

注意事项

NIM 与英伟达硬件深度优化,延迟低、吞吐高。1000 credits 约百万 token,适合评测与原型。credits 用尽返回 402;405B 消耗快;敏感数据走本地 NIM 容器(nvcr.io/nim/...)。

相关文章 / Related

Meta GPT-OSS 120B 入驻 Groq:120B MoE 免费可用,MMLU 90% + Groq LPU 低延迟实测Cerebras Inference 免费 API 完全指南:2000 tokens/s 极速推理,Llama 3.3 70B 零成本接入inclusionAI Ling 3.0 Flash Fin 免费 API:262K 上下文金融推理,零成本上线Cloudflare Workers AI 免费层完全指南:在边缘运行 Llama 3、Mistral 等开源模型Pollinations AI 免费 API 实测:图像真免 Key,文本必须匿名才免费(带 Key 反而 402)