⚠️ 待更新·2026-08-29核验 · 更新时间待核验 · 本文信息可能已过期,请以官方文档为准 更新时间:2026-08-29 · 核验状态:待更新 · 官方溯源待补
简介
NVIDIA NIM(NVIDIA Inference Microservices)是 NVIDIA 推出的容器化推理服务,把 TensorRT-LLM、Triton 等优化打包成 OpenAI 兼容 API。它有两种使用方式:本地用 Docker 跑容器,或直接调用 build.nvidia.com 上的云端端点。本篇分别演示,并给出选型建议。
架构图
方式一:本地容器部署
前置条件:NVIDIA GPU(显存 ≥ 16GB)+ 驱动 ≥ 535、nvidia-container-toolkit、NGC 账号。
# 1. 登录 NGC 拉取镜像
docker login nvcr.io -u '$oauthtoken' -p "$(cat ngc-key.txt)"
# 2. 拉取 Llama-3.1-8B NIM 镜像
docker pull nvcr.io/nim/meta/llama-3.1-8b-instruct:1.0.0
# 3. 启动容器(单卡)
docker run -d --name nim-llama \
--runtime=nvidia --gpus all \
-e NGC_API_KEY=$(cat ngc-key.txt) \
-v $HOME/.cache/nim:/opt/nim/.cache \
-p 8000:8000 \
--shm-size=16g \
nvcr.io/nim/meta/llama-3.1-8b-instruct:1.0.0
首次启动会下载模型权重(约 16GB),完成后访问 http://localhost:8000/docs 查看 Swagger 文档,/v1/models 列出可用模型,/v1/chat/completions 是 OpenAI 兼容端点。
方式二:调用云端端点
不想自己装 GPU?直接用 build.nvidia.com 托管的端点。在 https://build.nvidia.com 注册并生成 NGC API Key,然后即可调用:
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "meta/llama-3.1-8b-instruct",
"messages": [{"role":"user","content":"hi"}],
"max_tokens": 128
}'
新账号有 1000 次免费调用额度,适合快速原型验证。云端还托管很多特色模型,如 nvidia/llama-3.1-nemotron-70b-instruct(NVIDIA 自研对齐版本)、deepseek-ai/deepseek-r1(推理模型)。
选型建议
| 维度 | 本地 NIM | 云端 NIM |
|---|---|---|
| 启动成本 | 高(需 A10/A100) | 0 |
| 延迟 | 低(本地 GPU) | 中(走公网) |
| 数据隐私 | 完全本地 | 数据出网 |
| 适用场景 | 内网/合规场景 | 原型/小流量 |
性能调优
- 开启 TensorRT-LLM:NIM 镜像默认启用,首次启动会编译引擎(约 5 分钟),之后推理提速 2-5 倍。
- 调整 batch size:在容器环境变量里设
NIM_MAX_BATCH_SIZE=128提升吞吐。 - 多卡推理:
--gpus all+NIM_TENSOR_PARALLEL_SIZE=2把模型切到两张卡上。
常见问题
CUDA out of memory:8B 模型至少需要 16GB 显存,加--shm-size=16g重试,或换 4B 模型。- 拉镜像 401:确认 NGC API Key 有效,且账号已加入 NIM early access。
- 想跑别的模型:在 https://build.nvidia.com 浏览所有可用 NIM 镜像,替换
nvcr.io/nim/<vendor>/<model>即可。 - 冷启动慢:容器首次启动需下载并编译引擎,生产环境用
--restart unless-stopped保活。
部署完成后,参考《NVIDIA NIM 推理调用示例》用 OpenAI SDK 调用。
部署对比
| 部署方式 | 优势 | 限制 |
|---|---|---|
| 云端 build.nvidia.com | 零运维,1000 credits | 共享 QPS,延迟有波动 |
| 本地 Docker NIM | 独占 GPU,低延迟 | 需 GPU 卡(A10/L4 起步) |
最佳实践
- 首次跑用云端:1000 credits 跑完调通流程,再决定是否上本地。
- 本地选 L4 而非 A10:L4 性价比高,单卡跑 7B-70B 量化版都够。
- NIM 容器要 GPU 驱动:装好 nvidia-docker runtime,否则容器看不到 GPU。
🚀 立即开始:免费 API 一键调用
想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本直连。
👉 立即注册 Apishare.cc → 获取你的统一 API Key
📊 想看更多免费模型排行?查看 2026年9月 免费 LLM API 综合实力榜单 →
立即上手:APIShare 免费 API 目录
- 🆓 注册领取免费额度:立即注册 APIShare · 登录控制台
- 🔍 浏览全部免费 API 与实时榜单:APIShare 免费 API 目录
- 📊 查看免费 LLM API 排行:Free LLM API Rankings
免费 API 聚合平台说明
本文涉及的模型均由 APIShare 免费 API 聚合平台 统一接入,一份 Key 调用全站模型。
- 完整模型目录:APIShare 免费 API 目录
- 注册即送免费额度:注册领取 API Key