免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线
免费中文分词文本处理中文NLPAPI教程ShowAPI # 免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线
> 接口:人名/地名/机构名识别(2663-2/3/4) / 关键词抽取(2663-6)|是否免费:是(含档位限制)|适用人群:内容平台 / CMS 开发者|阅读时间:约 7 分钟
## 核心要点
- 把「NER 抽实体」+「关键词抽取」串成一条流水线,文章一发进来就自动产出结构化标签。
- 实体(人物/地点/机构)做「命名实体标签」,关键词做「主题标签」,两类合并即内容元数据。
- 免费档位下各接入点可能返回空,流水线要兜底「成功但无标签」的情况。
## Why
内容平台最头疼的就是「文章进来了,没人打标签,后面检索、推荐、聚合都做不了」。人工打标签慢且不一致。用这条流水线,文章入库时自动挂上「人物/地点/机构 + 主题关键词」两类标签,检索、相关推荐、专题聚合立刻有了抓手。对 UGC、资讯、知识库都通用。
## What
**接口速览**
| 接入点 | 路径 | 产出标签类型 |
|------|------|------------|
| 人名识别 | 2663-2 | 人物标签 |
| 地名识别 | 2663-3 | 地点标签 |
| 机构名识别 | 2663-4 | 机构标签 |
| 关键词抽取 | 2663-6 | 主题标签 |
## How
一条文章自动打标签的流水线:
```python
import requests
APPKEY = "YOUR_APPKEY"
BASE = "https://route.showapi.com/2663-"
def call(path, **data):
resp = requests.post(BASE + path, params={"appKey": APPKEY},
data=data, timeout=10).json()
body = resp["showapi_res_body"]
if body.get("ret_code") != 0:
raise RuntimeError(body.get("remark"))
return body
def auto_tag(text):
tags = {}
tags["人物"] = [x["word"] for x in call("2", text=text).get("names", [])]
tags["地点"] = [x["word"] for x in call("3", text=text).get("places", [])]
tags["机构"] = [x["word"] for x in call("4", text=text).get("organs", [])]
tags["主题"] = call("6", text=text, num=5).get("list", [])
return tags
article = "马云创办的阿里巴巴位于杭州,与腾讯在深圳竞争。"
print(auto_tag(article))
# {'人物': ['马云'], '地点': ['杭州','深圳'], '机构': ['阿里巴巴','腾讯'], '主题': [...]}
```
## 返回示例与解析
关键词抽取(2663-6)返回主题标签:
```json
{
"showapi_res_body": { "ret_code": 0, "remark": "成功", "list": ["阿里巴巴", "杭州", "竞争"] }
}
```
- 实体类返回「词 + 词性」对象数组,取 `word` 即标签文本。
- 关键词返回字符串数组,直接作为主题标签。
## 进阶 / 边界
- **去重合并**:实体名可能与关键词重复(如「阿里巴巴」既在机构也在主题),入库前去重。
- **兜底空结果**:免费档下任一接入点可能返回空,流水线要容忍「部分标签缺失」,不要因一个接入点空就整条失败。
- **数量控制**:关键词 `num` 控制主题标签条数,按展示位数量取合理值。
## FAQ
**Q1:实体标签和关键词标签会重复吗?**
会,建议入库前去重合并。
**Q2:一个接入点返回空会拖垮整条流水线吗?**
不应。每个接入点独立 try,空结果只导致该类标签缺失。
**Q3:免费档返回空标签是失败吗?**
多为档位限制,先核对额度(见 [免费档位与调用策略](https://www.showapi.com/guides/cnseg-free-tier-2663))。
**Q4:能加摘要作为导语吗?**
能,叠加 [摘要抽取](https://www.showapi.com/guides/cnseg-keywords-summary-2663) 即可。
**Q5:标签顺序重要吗?**
按你的展示需求定;实体与主题分两类存储通常更利于检索。
## 相关能力 / 下一步阅读
- [免费中文分词(文本处理):如何用接口做人名/地名/机构名识别(NER 实战)](https://www.showapi.com/guides/cnseg-ner-2663)
- [免费中文分词(文本处理):自动提取文章关键词与摘要](https://www.showapi.com/guides/cnseg-keywords-summary-2663)
- [免费中文分词(文本处理):免费档位到底能调多少?](https://www.showapi.com/guides/cnseg-free-tier-2663)
> 本系列共 14 篇:查看[免费中文分词(文本处理)API 指南总目录](https://www.showapi.com/guides/cnseg-guides-2663)