← 返回文章列表 / Back to list
overview

免费 Embedding 模型 API 盘点

Free Embedding Model APIs Roundup

免费 Embedding 模型 API 盘点

Embedding(向量化)是 RAG、语义搜索、推荐系统的基石。本文盘点当前可通过 API 免费调用的 Embedding 模型,帮你选型不踩坑。

为什么需要 Embedding API?

Embedding 把文本映射为固定维度的浮点向量,使得语义相近的内容在向量空间中距离更近。核心应用场景包括:

  • RAG(检索增强生成):将知识库文档向量化后存入向量数据库,查询时用向量相似度召回相关片段
  • 语义搜索:摆脱关键词匹配的限制,按语义召回结果
  • 聚类与分类:对大量文本自动分组或打标签
  • 推荐系统:基于内容相似度做推荐

评估维度

选型时关注以下指标:

维度 说明
向量维度 384 / 768 / 1024 / 1536 / 3072,维度越高信息量越大但存储成本也更高
上下文窗口 单次输入最大 token 数,从 512 到 8192 不等
多语言支持 是否原生支持中文等多语言,还是以英文为主
速率限制 每分钟请求数 / token 数限制
MTEB 得分 Massive Text Embedding Benchmark 综合排名

1. OpenAI text-embedding-3-small(免费层)

  • 维度:1536(可降维至 256/512)
  • 上下文:8191 tokens
  • 多语言:支持 100+ 语言,中文表现优秀
  • 速率:通过 APIShare 统一调用可共享免费额度
  • 特点:业界标杆,降维参数 dimensions 可按需调整,兼顾效果与存储成本
import openai
client = openai.Client(
    base_url="https://apishare.cc/v1",
    api_key="your-token"
)
resp = client.embeddings.create(
    model="text-embedding-3-small",
    input="向量化这段文本",
    dimensions=512  # 可选降维
)

2. Hugging Face Inference API — BGE 系列

  • 模型BAAI/bge-large-en-v1.5BAAI/bge-m3
  • 维度:1024
  • 上下文:512 tokens(bge-large)/ 8192 tokens(bge-m3)
  • 多语言:bge-m3 原生支持中英日韩等 50+ 语言
  • 速率:免费层 1,000 次/天(Inference API)
  • 特点:bge-m3 同时输出稠密向量 + 稀疏向量 + ColBERT 多向量,一站式覆盖多种检索策略

3. NVIDIA NIM — NV-Embed-v2

  • 模型nvidia/nv-embed-v2
  • 维度:4096
  • 上下文:32768 tokens
  • 多语言:以英文为主
  • 速率:NIM 免费层 1,000 次/天
  • 特点:MTEB 排名长期 Top 3,超长上下文窗口适合整篇文档向量化

4. Jina AI — jina-embeddings-v3

  • 模型jinaai/jina-embeddings-v3
  • 维度:1024
  • 上下文:8192 tokens
  • 多语言:支持 89 种语言
  • 速率:免费 API key 每月 100 万 tokens
  • 特点:支持任务类型参数(task=retrieval.passage / task=retrieval.query),针对不同场景优化向量质量

5. Nomic AI — nomic-embed-text-v1.5

  • 模型nomic-ai/nomic-embed-text-v1.5
  • 维度:768
  • 上下文:8192 tokens
  • 多语言:以英文为主
  • 速率:完全开源,可在本地部署;Nomic Atlas 免费层提供 API
  • 特点:可解释性强,支持 Matryoshka 降维,模型权重完全开放

6. Voyage AI — voyage-3 / voyage-3-lite

  • 模型voyage-3 / voyage-3-lite
  • 维度:1024(voyage-3)/ 512(lite)
  • 上下文:32000 tokens
  • 多语言:支持中英文等 100+ 语言
  • 速率:免费层 50M tokens / 月
  • 特点:超长上下文 + MTEB 得分领先,适合法律、学术等长文档场景

7. Mixedbread — mxbai-embed-large-v1

  • 模型mixedbread-ai/mxbai-embed-large-v1
  • 维度:1024
  • 上下文:512 tokens
  • 多语言:以英文为主
  • 速率:Hugging Face Inference API 免费层可调用
  • 特点:MTEB 得分排名前列,模型仅 670M 参数,部署成本低

选型建议

场景 推荐模型 理由
中文 RAG OpenAI text-embedding-3-small / BGE-m3 中文效果最好
超长文档 NVIDIA NV-Embed-v2 / Voyage-3 上下文窗口 32K+
成本敏感 Nomic-embed / mxbai-embed 开源可本地部署
多语言 Jina-v3 / BGE-m3 覆盖 50+ 语言
低延迟 OpenAI text-embedding-3-small API 响应最快

通过 APIShare 统一调用

以上模型可通过 APIShare 统一入口调用,客户端只需维护一个 token,无需为每家供应商单独注册账号:

models = [
    "text-embedding-3-small",     # OpenAI
    "BAAI/bge-m3",                # Hugging Face
    "nvidia/nv-embed-v2",         # NVIDIA NIM
    "jinaai/jina-embeddings-v3",  # Jina
]
for model in models:
    resp = client.embeddings.create(model=model, input=text)
    print(model, len(resp.data[0].embedding))

总结

免费 Embedding API 的生态在 2026 年已非常成熟。中文场景首选 BGE-m3 或 OpenAI text-embedding-3-small;长文档场景选 NVIDIA NV-Embed-v2 或 Voyage-3;追求零成本可在本地部署 Nomic-embed 或 mxbai-embed。通过 APIShare 统一入口,你可以在一个 SDK 内自由切换所有模型,按场景选择最优向量质量。

相关文章 / Related

Cerebras Inference 免费 API 完全指南:2000 tokens/s 极速推理,Llama 3.3 70B 零成本接入Meta GPT-OSS 120B 入驻 Groq:120B MoE 免费可用,MMLU 90% + Groq LPU 低延迟实测inclusionAI Ling 3.0 Flash Fin 免费 API:262K 上下文金融推理,零成本上线Cloudflare Workers AI 免费层完全指南:在边缘运行 Llama 3、Mistral 等开源模型Pollinations AI 免费 API 实测:图像真免 Key,文本必须匿名才免费(带 Key 反而 402)