免费命名实体识别(NER)API 完全教程:零成本从文本里挖出人名/地名/金额(2026-10-04 验证)
一句话结论:想把"非结构化文本"自动变成"结构化的实体标签"(人名、地名、组织、金额、日期),又不想为 token 计价和 GPU 买单?Azure AI Language、Amazon Comprehend、Google Cloud Natural Language 三家的免费额度,配合开源 spaCy,足以支撑大多数信息抽取、舆情监控、知识图谱场景。本文 2026-10-04 实测四家渠道的免费额度与调用门槛,全部命令可复现。
一、什么是 NER,为什么值得做
命名实体识别(Named Entity Recognition,简称 NER)是自然语言处理里最"立竿见影"的一项能力:给一段文本,它自动把其中的专有名词识别并打上类别标签。常见的类别包括:人名(PER)、地名(LOC)、组织(ORG)、金额(MONEY)、日期(DATE)、时间(TIME)、百分比(PERCENT)等。
举例:输入"苹果公司 CEO 蒂姆·库克昨天在旧金山宣布,第三季度营收 900 亿美元",NER 会输出:
- "苹果公司" → ORG(组织)
- "蒂姆·库克" → PER(人名)
- "旧金山" → LOC(地名)
- "昨天" → DATE(日期)
- "900 亿美元" → MONEY(金额)
这不是关键词匹配那么简单——NER 模型能够理解上下文,区分"苹果"是水果还是公司、区分"华盛顿"是人还是城市。这正是它比正则表达式强大的地方,也是它被广泛用于下游任务的原因。更多这类免费能力,可在本站 免费 API 栏目 一站式查看,无需逐个注册。
二、NER 是怎么工作的
早期的 NER 靠规则和词典:先准备一份人名、地名、机构名词典,再把文本和词典做字符串匹配。这种方式快但很脆——覆盖不到的实体直接漏掉,"苹果"这种多义词也分不清。
现代 NER 主要走深度学习路线,大致分两类:
- 统计序列标注:把句子拆成一个个 token,模型预测每个 token 属于哪个实体边界(B-开头、I-内部、O-非实体)。这类模型轻、快,适合实时调用。
- 大模型抽取:直接让 LLM 按提示词输出结构化实体 JSON。能力更强、能理解复杂语境,但对长文成本较高、需要多次调用。
对大多数免费额度场景,云厂商的预训练 NER(本质是成熟的序列标注模型)已经够用,你无需自己训练模型,开箱即用。关于大模型那一路的免费额度,可参考本站 免费 LLM API 榜单 里的免费模型清单。
三、四个典型落地场景
以下场景所需的多项免费能力,均可在本站 免费 API 栏目 找到可复现的入门教程,不必重复造轮子。
- 舆情监控:从海量新闻里自动抽取"哪个公司/产品/人物"被提及,做声量统计与竞品追踪。比如每天抓取 1000 条新闻,用 NER 提取出现频次最高的品牌名和人物名。
- 金融情报:从财报、公告里抽取金额、日期、交易对手方,辅助风控与合规审核。财报里动辄几十个数字,NER 能一键结构化。
- 知识图谱:把实体和关系结构化,喂给图数据库做推理与问答。实体识别是建图的第一步,没有实体就没有节点。
- 客服工单:自动识别工单里提到的订单号、地点、产品型号,做自动分流,减少人工分派时间。
四、四家免费 NER 渠道横评(2026-10-04 实测)
为了让你选对方案,我把 2026 年主流的免费 NER 渠道放在一起对比:
| 渠道 | 免费额度 | 是否需信用卡 | 实体类别 | 核心优势 |
|---|---|---|---|---|
| Azure AI Language | 5000 transactions/月 | 否(F0 免费层) | 4 类、多语言 | 微软官方、预训练质量高 |
| Amazon Comprehend | 50K units(500万字符)/月/API | 是(需 AWS 账号) | 12 类、含 PII | 类别最全、专有 PII 检测 |
| Google Cloud Natural Language | 5000 units/月(永久) | 否(需 GCP 项目) | 多语言 | 永久免费 + $300 新客赠金 |
| spaCy(开源) | 完全免费、无上限 | 否 | 数十种语言模型 | 本地跑、数据不出网 |
额度数据复核至 2026-10-04 各厂商公开文档,实际以控制台为准。两个关键差异:一是三家云服务按"调用次数/字符单位"计费、有免费额度上限,spaCy 本地开源完全免费但需自己部署;二是只有 Amazon Comprehend 提供专门的 PII(敏感信息)检测能力。
五、5 分钟上手(Azure AI Language 实测)
Azure AI Language 的 NER 是预构建能力,不需要训练模型,申请好 Key 后直接调用。上手流程:
- 在 Azure Portal 创建"语言服务"资源,定价层选择 F0(免费)。
- 复制资源的 Endpoint 和 Key(注意 Key 只在创建后展示一次)。
- 用下方 Python 脚本发送文本,即可拿到实体标注结果。
限额头实测:免费层单次请求最多支持 5120 字符输入,月限额 5000 次交易,超限会返回 429。把长文本切成 5120 字符内的块,一次塞满比多次小额请求划算得多。
六、Python 调用方式(唯一代码示例)
用 Azure AI Language 的官方 SDK,几行代码即可完成实体识别:
# pip install azure-ai-textanalytics
from azure.ai.textanalytics import TextAnalyticsClient
from azure.core.credentials import AzureKeyCredential
client = TextAnalyticsClient(
endpoint="https://<你的资源名>.cognitiveservices.azure.com/",
credential=AzureKeyCredential("<你的Key>"),
)
docs = ["苹果公司 CEO 蒂姆·库克昨天在旧金山宣布,第三季度营收 900 亿美元。"]
result = client.recognize_entities(docs)[0]
for entity in result.entities:
print(f"{entity.text} -> {entity.category} (置信度 {entity.confidence_score:.2f})")
要点:返回的每个实体都带 text(原文)、category(类别)、confidence_score(置信度,越高越准)。生产环境建议对置信度低于 0.5 的结果做人工复核,避免把"苹果"误判成公司。
七、三家的实体类别对照表
不同渠道预定义的实体类别略有差异,选型前先对一遍:
| 实体类型 | Azure AI Language | Amazon Comprehend | Google Cloud NL |
|---|---|---|---|
| 人名 | Person | PERSON | PERSON |
| 组织 | Organization | ORGANIZATION | ORGANIZATION |
| 地点 | Location | LOCATION | LOCATION |
| 金额 | Quantity | QUANTITY | MONEY |
| 日期时间 | DateTime | DATE | DATE |
| 其他 | 产品、事件等 | 含 PII、事件等 12 类 | 事件、作品等 |
需要识别"身份证号、银行卡号、邮箱"等敏感信息时,Amazon Comprehend 的 Detect PII 是专门能力,Azure 和 Google 的通用 NER 不覆盖,这是选型时最容易被忽略的差异。
八、七条避坑清单(这部分比前面都重要)
- 免费层有字符上限:Azure F0 单请求 5120 字符,Amazon 单请求最小计费 300 字符,超长文本要先分块再拼接。
- 额度是"交易次"不是"实体个":Azure 按"一次请求"计 1 次交易,一次塞满 5120 字符比 10 次小额请求划算得多。
- 置信度要做阈值:通用 NER 对生僻实体(小众品牌、方言地名)会出错,低于阈值的结果要人工兜底。
- 语言要匹配模型:中文文本用中文模型,英文用英文模型,混用会显著掉准。
- 偶发超限要退避重试:云服务高峰期会返回 429,脚本加指数退避(3 次,间隔 1s/2s/4s)。
- 敏感数据慎上网:涉及隐私/合规文本,优先用 spaCy 本地跑,数据不出网。
- 免费额度会变:云厂商免费额度策略调整频繁,生产前以官方定价页为准。
本文实测数据复核至 2026-10-04。免费策略变更频繁,生产使用前请以厂商官方文档为准。
九、常见问题 FAQ
- 问:免费额度够不够用? 答:以 Azure 5000 次/月为例,假设每天处理 150 条新闻,一个月约 4500 次,绰绰有余;PC 端个人项目几乎用不满。
- 问:中文效果哪家好? 答:Azure AI Language 的中文预训练模型质量稳定,是中文场景的首选;追求类别全面选 Amazon,追求永久免费选 Google。
- 问:不想上传数据怎么办? 答:用 spaCy 本地跑,模型下载后完全离线,数据不出网,适合合规敏感场景;其余免费文本能力见 免费 API 栏目,跨语言翻译等任务亦可在专栏内找到对应指南。
十、把 NER 与文本 API 统一管起来
做完实体识别,往往还要做后续处理——关键词提取做主题、语义相似度做去重、RAG 做知识库检索。这些能力都能在 免费 API 栏目 找到对应免费方案。本站已沉淀一批可复用的免费能力教程:
- 免费关键词提取 / 主题抽取 API 完全教程
- 免费语义相似度(STS)API 完全教程
- 免费 Reranker(重排序)API 完全教程
- 免费向量数据库 API 实力榜单
- 免费 Embedding API 完全教程
- 2026 免费翻译 API 实力榜单
免费额度领取与继续阅读
想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本接入。新用户可前往 注册页 领取免费额度,更多免费能力教学与榜单尽在 免费 API 栏目。