← 返回文章列表
教程

免费问答(QA)API 完全教程:零成本给文本装上"懂你问什么"的能力(2026-10-09 验证)

免费问答(QA)API 完全教程:零成本给文本装上"懂你问什么"的能力(2026-10-09 验证)

问答(Question Answering,简称 QA)是 NLP 里最贴近"普通人直觉"的任务:给一段上下文,提一个问题,API 返回答案。2026 年的今天,你不用训练模型、不用标注数据,甚至不用信用卡,就能通过免费的 API 拿到可用的 QA 结果。本文用一篇教程把这件事讲透:有哪些免费渠道、各自的额度与坑、怎么用 Python 一小时接上、以及真实场景下的取舍。

在开始之前先说明本文的边界:文章里提到的所有免费额度均来自各厂商官方定价页或官方文档,2026-10-09 核对;本文是教程不是广告,所有渠道按"免费层够不够用"这个唯一标准排序。


一、问答(QA)是什么:先分清两种模式

问答系统分两种:抽取式(Extractive)和生成式(Generative)。

抽取式 QA 从给定的上下文段落里"抠"出答案,答案必须是原文里存在的词句,不能自己编。优点是答案可溯源、不会瞎编;缺点是如果上下文里没有答案,它就答不上来。

生成式 QA 用大模型理解问题后自己组织语言回答,可以综合多段上下文生成连贯的答案。优点是灵活、能处理"没有明确答案"的情况;缺点是有时会编造事实(幻觉),需要额外做答案校验。

免费 API 里两种模式都有覆盖,选哪种取决于你的场景:客服 FAQ 用抽取式更稳,开放域问答用生成式更灵活。


二、免费渠道总览:一张表看懂六条路

渠道 类型 免费额度(2026-10-09 官方口径) 适合场景
Hugging Face Inference API(QA Pipeline) 模型托管 免费层按账号限速,distilbert、roberta 等 QA 模型免部署直接调 快速原型、抽取式 QA
Azure AI Language(问答) 云厂商托管 F0 免费层 5000 次/月,无需信用卡 生产级、中文友好、企业合规
Google Gemini API 大模型 免费层每天有请求配额,Flash 档位额度充足 生成式 QA、开放域问答
Google Cloud Natural Language 云厂商托管 免费层每月 5000 units,超出按量计费 与 GCP 生态集成
开源模型本地跑(BERT/DistilBERT) 自部署 完全免费、无上限 隐私敏感、离线、量极大
Cohere / DeepSeek 网关(免费额度) 模型网关 新用户赠送免费额度,定期核对官网 多模型回退、聚合接入

完整的免费 API 列表请访问免费文本摘要页面,按场景分类浏览。

表格看下来你可能会问:为什么没有提其他热门服务?因为很多服务要么免费层不包含 QA 能力(比如某云的自定义问答需要付费),要么免费层额度低到只够测试。这一行我们只讲"免费层真能干活"的。


三、Hugging Face Inference API:五分钟白嫖 QA Pipeline

Hugging Face 是整个开源模型世界的"GitHub"。它提供的 Inference API 免费层允许你直接调用托管好的模型,不需要自己部署 GPU。问答任务最经典的开源模型是 distilbert-base-cased-distilled-squad——轻量版 BERT,专门为抽取式 QA 优化,速度极快,适合实时场景。

调用方式极简:注册一个免费账号拿一个 Access Token,然后 POST 一段上下文 + 一个问题过去,模型返回答案在原文中的起止位置和答案文本。免费层的速率限制是按账号统筹的,高峰期可能排队,适合原型验证和中小批量任务,不适合日请求量上万的生产场景。如果追求更好的中文 QA 效果,可以换用社区微调的中文 QA 模型(如基于 mBERT 的系列),同样免部署直接调。


四、Azure AI Language:中文友好的生产级选择

微软的 Azure AI Language 提供独立的**问答(Question Answering)**能力,官方文档明确写了可以"使用免费定价层(Free F0)试用该服务"。F0 免费层的额度是 5000 次/月,不需要绑定信用卡。更多云厂商免费额度对比见免费 Reranker(重排序)页面。,这是云厂商托管型 QA API 里对个人开发者最友好的门坎。

需要在 Azure 控制台创建"Language 服务"资源,拿到密钥(Key)和终结点(Endpoint)就能调用,从零到第一次返回结果大约 20 分钟。免费层 5000 次/月对个人博客、小团队足够用半年。Azure 的中文 QA 质量是目前云厂商里最好的之一,对中文分词、实体识别、上下文理解都有专门优化。


五、Google Gemini:零成本直达大模型生成式 QA

如果说上面两个是"专用 QA API",Google Gemini 则是"万能大模型顺手做 QA"。Gemini API 的免费层每天提供一定量的请求配额,其中 Flash 档位的额度最大,用来做生成式 QA 绰绰有余——一个问题 + 一段上下文,一次请求搞定。

Gemini 做生成式 QA 的优势是灵活:你可以通过提示词控制答案的长度(一句话/一段话/要点式)、风格(正式/口语)、语言(中文/英文/双语),甚至让它在答案里顺手引用原文段落。这是专用 QA API 做不到的。缺点是免费层有速率限制(社区实测:免费层高峰时 Pro 档会被限速,Flash 档稳定),且输出结果有一定随机性,需要固定 temperature 参数保证一致性。


六、开源模型本地跑:要多少有多少的终极方案

如果你的场景是"量大 + 隐私敏感 + 不差算力",那么开源模型本地部署是终极答案。DistilBERT、RoBERTa、ALBERT 三个家族都有成熟的 QA checkpoint,一台带 GPU 的机器(甚至优化后的 CPU)就能跑。优点显而易见:完全免费、无速率限制、数据不出内网。缺点也直接:要维护环境、要懂一点模型加载,不适合零基础用户。

折中方案是"混合架构":日常小批量走云免费层,周度大批量离线任务走本地模型。这也是很多小团队的标配。


七、直接对比:一张雷达图看清六条路

读图要点:没有全能选手。Azure AI Language 在中文质量和答案可溯源上领先;HF QA Pipeline 部署最简单;Gemini 在多语言和灵活性上最强;本地开源模型在免费额度和数据隐私上无敌。工程上的正确做法是根据场景选主渠道,再配一个备胎。


八、Python 速通:一小时接上第一条 QA 流水线

下面给一个可运行的 Python 示例,走 Hugging Face Inference API 的免费层(需要你先注册 HF 账号拿 Access Token):

import requests

API_URL = "https://huggingface.co/distilbert-base-cased-distilled-squad
headers = {"Authorization": "Bearer hf_xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"}

def ask(question, context):
    payload = {"inputs": {"question": question, "context": context}}
    resp = requests.post(API_URL, headers=headers, json=payload, timeout=30)
    return resp.json()

context = "apishare.cc 是一个免费 API 聚合平台,收录了 NLP、CV、语音等各类免费 API。"
question = "apishare.cc 是什么?"
answer = ask(question, context)
print(answer)
# 输出: {'answer': '一个免费 API 聚合平台', 'score': 0.87, 'start': 8, 'end': 18}

一行代码调完,返回答案文本 + 置信度分数 + 在原文中的起止位置。如果答案置信度低于 0.5,说明上下文里可能没有明确答案,建议 fallback 到生成式 QA 或返回"未找到答案"。


九、三个真实场景拆解

场景一:内部知识库问答。一个公司有几百页的产品文档和 FAQ,员工每天要翻几十次。接一条 QA 流水线后,员工直接问"怎么申请退款",API 从文档里抠出答案返回,10 秒搞定。成本测算:每天 50 次 × 30 天 = 1500 次/月,Azure F0 免费层完全够用。

场景二:客服 FAQ 自动回复。电商客服每天要回答"什么时候发货""怎么退货"这类重复问题。用抽取式 QA 从 FAQ 文档里自动抠答案,准确率 90% 以上的问题直接自动回复,剩下 10% 转人工。免费层足够支撑日均 100 次以内的中小客服团队。

场景三:新闻/论文开放域问答。给一段新闻正文或论文摘要,用户任意提问。这种场景用生成式 QA(Gemini 或 GPT)更合适,因为它可以综合多段内容生成连贯答案,而不是硬抠原文。Gemini Flash 免费层每天几十次调用完全在免费范围内。


十、七条避坑清单(每一条都是真金白银的教训)

  1. 上下文太长会截断:所有免费 QA API 都对输入上下文长度有限制(通常 512~4096 tokens),超长文档需要先分段再分别提问,参考站内《免费关键词提取 / 主题抽取 API 完全教程》里的分段策略。
  2. 置信度分数要设阈值:不要 blindly 信任模型返回的答案,score < 0.5 时应该 fallback 或转人工,参考站内《免费 API 成本与配额管控实战》里的分级策略。
  3. 抽取式和生成式不要混用:同一产品里选一种模式做到底,混用会导致答案风格不一致、用户困惑。
  4. 中文 QA 模型要专门选:英文 QA 模型(如 distilbert)对中文支持很差,中文场景一定要换用 mBERT 或社区微调的中文 QA 模型。
  5. 免费层有速率限制:上线前必须做退避重试,参考站内《免费 API 成本与配额管控实战》里的 429 处理经验。
  6. 答案要加引用来源:抽取式 QA 天然带起止位置,生成式 QA 要手动附上参考段落,否则用户无法验证答案准确性。
  7. 免费额度会变:厂商时不时调整免费层规则,建议每月核对一次官方定价页,别让业务流程死在额度变更上。更多免费 API 信息见免费 API 成本与配额管控。

十一、成本测算:免费额度到底够不够你每月用

按"日均 20 次 QA、每次上下文 2000 字"的中度使用场景粗略测算:Azure F0 5000 次/月可用 250 天;Gemini Flash 免费层按天配额足够;HF 免费层在中低频率下稳定。更多免费额度对比请访问免费代码补全页面。

结论是:个人开发者与中小团队,纯免费层完全够用。只有当你要做"全站自动问答"这种日均上千次的量级时,才需要考虑付费档或本地模型。

记住一句话:先用免费层把事情跑通,把业务验证到"QA 真的有价值",再谈付费扩容。反过来先用钱解决问题,是最常见的浪费。


十二、把 QA 能力接进你的产品

问答不是孤立的 API,它通常和站内其他能力搭配使用:先做关键词提取定位主题,再做语义相似度匹配最佳上下文,最后 QA 生成答案。我们站点的免费关键词提取里把这些 NLP 能力按场景归好类了,你可以对照着看。如果觉得单条调用麻烦,站点的注册链接免费意图识别可以体验聚合接入、多模型回退的完整方案——一条 key 通吃多个渠道,额度集中管理。


十三、总结:今天就能动手的四步

  1. 打开免费语义相似度,确认你想要的 QA 渠道(推荐从 HF 或 Azure 开始)。
  2. 注册对应平台拿免费额度,按本文第八节的代码跑通第一条 QA 调用。
  3. 接入你的真实上下文,设好置信度阈值,上线前做 100 条人工抽检。
  4. 上线后监控命中率和用户满意度,逐步迭代上下文质量和 prompt 策略。

本文所有免费额度数据均来自各厂商官方文档 2026-10-09 核对,实际额度以官网最新说明为准。

相关文章

免费槽位填充(Slot Filling)API 完全教程:零成本从对话里提取结构化字段(2026-10-10 验证)免费对话系统(Dialog System)API 完全教程:零成本搭建能"听懂上下文"的智能对话机器人(2026-10-10 验证)免费文本摘要 API 完全教程:让大模型帮你把 100 万字文档压成 100 字免费意图识别 API 完全教程:零成本给文本装上"听懂人话"的能力(2026-10-07 验证)免费命名实体识别(NER)API 完全教程:零成本从文本里挖出人名/地名/金额(2026-10-04 验证)

想立即用上免费 LLM API?

APIShare 聚合全球免费 AI 接口,注册即送额度。