← 返回文章列表
教程

免费命名实体识别(NER)API 完全教程:零成本从文本里挖出人名/地名/金额(2026-10-04 验证)

免费命名实体识别(NER)API 完全教程:零成本从文本里挖出人名/地名/金额(2026-10-04 验证)

一句话结论:想把"非结构化文本"自动变成"结构化的实体标签"(人名、地名、组织、金额、日期),又不想为 token 计价和 GPU 买单?Azure AI Language、Amazon Comprehend、Google Cloud Natural Language 三家的免费额度,配合开源 spaCy,足以支撑大多数信息抽取、舆情监控、知识图谱场景。本文 2026-10-04 实测四家渠道的免费额度与调用门槛,全部命令可复现。

一、什么是 NER,为什么值得做

命名实体识别(Named Entity Recognition,简称 NER)是自然语言处理里最"立竿见影"的一项能力:给一段文本,它自动把其中的专有名词识别并打上类别标签。常见的类别包括:人名(PER)、地名(LOC)、组织(ORG)、金额(MONEY)、日期(DATE)、时间(TIME)、百分比(PERCENT)等。

举例:输入"苹果公司 CEO 蒂姆·库克昨天在旧金山宣布,第三季度营收 900 亿美元",NER 会输出:

  • "苹果公司" → ORG(组织)
  • "蒂姆·库克" → PER(人名)
  • "旧金山" → LOC(地名)
  • "昨天" → DATE(日期)
  • "900 亿美元" → MONEY(金额)

这不是关键词匹配那么简单——NER 模型能够理解上下文,区分"苹果"是水果还是公司、区分"华盛顿"是人还是城市。这正是它比正则表达式强大的地方,也是它被广泛用于下游任务的原因。更多这类免费能力,可在本站 免费 API 栏目 一站式查看,无需逐个注册。

二、NER 是怎么工作的

早期的 NER 靠规则和词典:先准备一份人名、地名、机构名词典,再把文本和词典做字符串匹配。这种方式快但很脆——覆盖不到的实体直接漏掉,"苹果"这种多义词也分不清。

现代 NER 主要走深度学习路线,大致分两类:

  1. 统计序列标注:把句子拆成一个个 token,模型预测每个 token 属于哪个实体边界(B-开头、I-内部、O-非实体)。这类模型轻、快,适合实时调用。
  2. 大模型抽取:直接让 LLM 按提示词输出结构化实体 JSON。能力更强、能理解复杂语境,但对长文成本较高、需要多次调用。

对大多数免费额度场景,云厂商的预训练 NER(本质是成熟的序列标注模型)已经够用,你无需自己训练模型,开箱即用。关于大模型那一路的免费额度,可参考本站 免费 LLM API 榜单 里的免费模型清单。

三、四个典型落地场景

以下场景所需的多项免费能力,均可在本站 免费 API 栏目 找到可复现的入门教程,不必重复造轮子。

  1. 舆情监控:从海量新闻里自动抽取"哪个公司/产品/人物"被提及,做声量统计与竞品追踪。比如每天抓取 1000 条新闻,用 NER 提取出现频次最高的品牌名和人物名。
  2. 金融情报:从财报、公告里抽取金额、日期、交易对手方,辅助风控与合规审核。财报里动辄几十个数字,NER 能一键结构化。
  3. 知识图谱:把实体和关系结构化,喂给图数据库做推理与问答。实体识别是建图的第一步,没有实体就没有节点。
  4. 客服工单:自动识别工单里提到的订单号、地点、产品型号,做自动分流,减少人工分派时间。

四、四家免费 NER 渠道横评(2026-10-04 实测)

为了让你选对方案,我把 2026 年主流的免费 NER 渠道放在一起对比:

渠道 免费额度 是否需信用卡 实体类别 核心优势
Azure AI Language 5000 transactions/月 否(F0 免费层) 4 类、多语言 微软官方、预训练质量高
Amazon Comprehend 50K units(500万字符)/月/API 是(需 AWS 账号) 12 类、含 PII 类别最全、专有 PII 检测
Google Cloud Natural Language 5000 units/月(永久) 否(需 GCP 项目) 多语言 永久免费 + $300 新客赠金
spaCy(开源) 完全免费、无上限 否 数十种语言模型 本地跑、数据不出网

额度数据复核至 2026-10-04 各厂商公开文档,实际以控制台为准。两个关键差异:一是三家云服务按"调用次数/字符单位"计费、有免费额度上限,spaCy 本地开源完全免费但需自己部署;二是只有 Amazon Comprehend 提供专门的 PII(敏感信息)检测能力。

五、5 分钟上手(Azure AI Language 实测)

Azure AI Language 的 NER 是预构建能力,不需要训练模型,申请好 Key 后直接调用。上手流程:

  1. 在 Azure Portal 创建"语言服务"资源,定价层选择 F0(免费)。
  2. 复制资源的 Endpoint 和 Key(注意 Key 只在创建后展示一次)。
  3. 用下方 Python 脚本发送文本,即可拿到实体标注结果。

限额头实测:免费层单次请求最多支持 5120 字符输入,月限额 5000 次交易,超限会返回 429。把长文本切成 5120 字符内的块,一次塞满比多次小额请求划算得多。

六、Python 调用方式(唯一代码示例)

用 Azure AI Language 的官方 SDK,几行代码即可完成实体识别:

# pip install azure-ai-textanalytics
from azure.ai.textanalytics import TextAnalyticsClient
from azure.core.credentials import AzureKeyCredential

client = TextAnalyticsClient(
    endpoint="https://<你的资源名>.cognitiveservices.azure.com/",
    credential=AzureKeyCredential("<你的Key>"),
)

docs = ["苹果公司 CEO 蒂姆·库克昨天在旧金山宣布,第三季度营收 900 亿美元。"]
result = client.recognize_entities(docs)[0]

for entity in result.entities:
    print(f"{entity.text} -> {entity.category} (置信度 {entity.confidence_score:.2f})")

要点:返回的每个实体都带 text(原文)、category(类别)、confidence_score(置信度,越高越准)。生产环境建议对置信度低于 0.5 的结果做人工复核,避免把"苹果"误判成公司。

七、三家的实体类别对照表

不同渠道预定义的实体类别略有差异,选型前先对一遍:

实体类型 Azure AI Language Amazon Comprehend Google Cloud NL
人名 Person PERSON PERSON
组织 Organization ORGANIZATION ORGANIZATION
地点 Location LOCATION LOCATION
金额 Quantity QUANTITY MONEY
日期时间 DateTime DATE DATE
其他 产品、事件等 含 PII、事件等 12 类 事件、作品等

需要识别"身份证号、银行卡号、邮箱"等敏感信息时,Amazon Comprehend 的 Detect PII 是专门能力,Azure 和 Google 的通用 NER 不覆盖,这是选型时最容易被忽略的差异。

八、七条避坑清单(这部分比前面都重要)

  1. 免费层有字符上限:Azure F0 单请求 5120 字符,Amazon 单请求最小计费 300 字符,超长文本要先分块再拼接。
  2. 额度是"交易次"不是"实体个":Azure 按"一次请求"计 1 次交易,一次塞满 5120 字符比 10 次小额请求划算得多。
  3. 置信度要做阈值:通用 NER 对生僻实体(小众品牌、方言地名)会出错,低于阈值的结果要人工兜底。
  4. 语言要匹配模型:中文文本用中文模型,英文用英文模型,混用会显著掉准。
  5. 偶发超限要退避重试:云服务高峰期会返回 429,脚本加指数退避(3 次,间隔 1s/2s/4s)。
  6. 敏感数据慎上网:涉及隐私/合规文本,优先用 spaCy 本地跑,数据不出网。
  7. 免费额度会变:云厂商免费额度策略调整频繁,生产前以官方定价页为准。

本文实测数据复核至 2026-10-04。免费策略变更频繁,生产使用前请以厂商官方文档为准。

九、常见问题 FAQ

  • 问:免费额度够不够用? 答:以 Azure 5000 次/月为例,假设每天处理 150 条新闻,一个月约 4500 次,绰绰有余;PC 端个人项目几乎用不满。
  • 问:中文效果哪家好? 答:Azure AI Language 的中文预训练模型质量稳定,是中文场景的首选;追求类别全面选 Amazon,追求永久免费选 Google。
  • 问:不想上传数据怎么办? 答:用 spaCy 本地跑,模型下载后完全离线,数据不出网,适合合规敏感场景;其余免费文本能力见 免费 API 栏目,跨语言翻译等任务亦可在专栏内找到对应指南。

十、把 NER 与文本 API 统一管起来

做完实体识别,往往还要做后续处理——关键词提取做主题、语义相似度做去重、RAG 做知识库检索。这些能力都能在 免费 API 栏目 找到对应免费方案。本站已沉淀一批可复用的免费能力教程:

免费额度领取与继续阅读

想要无需逐一注册、统一鉴权调用以上全部免费模型?Apishare.cc 提供统一 API Key,一个 Key 调用 100+ 模型,免费模型零成本接入。新用户可前往 注册页 领取免费额度,更多免费能力教学与榜单尽在 免费 API 栏目。

相关文章

免费文本摘要 API 完全教程:让大模型帮你把 100 万字文档压成 100 字免费意图识别 API 完全教程:零成本给文本装上"听懂人话"的能力(2026-10-07 验证)免费时间序列预测 API 完全教程:零成本给销售/库存/电价装上“水晶球”(2026-10-03 验证)免费语义相似度(STS)API 完全教程:零成本给文本装上"像不像"的尺子(2026-10-02 验证)免费语音克隆(Voice Cloning)API 完全教程:用一段参考音频复刻你的专属音色

想立即用上免费 LLM API?

APIShare 聚合全球免费 AI 接口,注册即送额度。