技术博客
免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线

免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线

作者: 万维易源
2026-09-03
免费中文分词文本处理中文NLPAPI教程ShowAPI
# 免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线 > 接口:人名/地名/机构名识别(2663-2/3/4) / 关键词抽取(2663-6)|是否免费:是(含档位限制)|适用人群:内容平台 / CMS 开发者|阅读时间:约 7 分钟 ## 核心要点 - 把「NER 抽实体」+「关键词抽取」串成一条流水线,文章一发进来就自动产出结构化标签。 - 实体(人物/地点/机构)做「命名实体标签」,关键词做「主题标签」,两类合并即内容元数据。 - 免费档位下各接入点可能返回空,流水线要兜底「成功但无标签」的情况。 ## Why 内容平台最头疼的就是「文章进来了,没人打标签,后面检索、推荐、聚合都做不了」。人工打标签慢且不一致。用这条流水线,文章入库时自动挂上「人物/地点/机构 + 主题关键词」两类标签,检索、相关推荐、专题聚合立刻有了抓手。对 UGC、资讯、知识库都通用。 ## What **接口速览** | 接入点 | 路径 | 产出标签类型 | |------|------|------------| | 人名识别 | 2663-2 | 人物标签 | | 地名识别 | 2663-3 | 地点标签 | | 机构名识别 | 2663-4 | 机构标签 | | 关键词抽取 | 2663-6 | 主题标签 | ## How 一条文章自动打标签的流水线: ```python import requests APPKEY = "YOUR_APPKEY" BASE = "https://route.showapi.com/2663-" def call(path, **data): resp = requests.post(BASE + path, params={"appKey": APPKEY}, data=data, timeout=10).json() body = resp["showapi_res_body"] if body.get("ret_code") != 0: raise RuntimeError(body.get("remark")) return body def auto_tag(text): tags = {} tags["人物"] = [x["word"] for x in call("2", text=text).get("names", [])] tags["地点"] = [x["word"] for x in call("3", text=text).get("places", [])] tags["机构"] = [x["word"] for x in call("4", text=text).get("organs", [])] tags["主题"] = call("6", text=text, num=5).get("list", []) return tags article = "马云创办的阿里巴巴位于杭州,与腾讯在深圳竞争。" print(auto_tag(article)) # {'人物': ['马云'], '地点': ['杭州','深圳'], '机构': ['阿里巴巴','腾讯'], '主题': [...]} ``` ## 返回示例与解析 关键词抽取(2663-6)返回主题标签: ```json { "showapi_res_body": { "ret_code": 0, "remark": "成功", "list": ["阿里巴巴", "杭州", "竞争"] } } ``` - 实体类返回「词 + 词性」对象数组,取 `word` 即标签文本。 - 关键词返回字符串数组,直接作为主题标签。 ## 进阶 / 边界 - **去重合并**:实体名可能与关键词重复(如「阿里巴巴」既在机构也在主题),入库前去重。 - **兜底空结果**:免费档下任一接入点可能返回空,流水线要容忍「部分标签缺失」,不要因一个接入点空就整条失败。 - **数量控制**:关键词 `num` 控制主题标签条数,按展示位数量取合理值。 ## FAQ **Q1:实体标签和关键词标签会重复吗?** 会,建议入库前去重合并。 **Q2:一个接入点返回空会拖垮整条流水线吗?** 不应。每个接入点独立 try,空结果只导致该类标签缺失。 **Q3:免费档返回空标签是失败吗?** 多为档位限制,先核对额度(见 [免费档位与调用策略](https://www.showapi.com/guides/cnseg-free-tier-2663))。 **Q4:能加摘要作为导语吗?** 能,叠加 [摘要抽取](https://www.showapi.com/guides/cnseg-keywords-summary-2663) 即可。 **Q5:标签顺序重要吗?** 按你的展示需求定;实体与主题分两类存储通常更利于检索。 ## 相关能力 / 下一步阅读 - [免费中文分词(文本处理):如何用接口做人名/地名/机构名识别(NER 实战)](https://www.showapi.com/guides/cnseg-ner-2663) - [免费中文分词(文本处理):自动提取文章关键词与摘要](https://www.showapi.com/guides/cnseg-keywords-summary-2663) - [免费中文分词(文本处理):免费档位到底能调多少?](https://www.showapi.com/guides/cnseg-free-tier-2663) > 本系列共 14 篇:查看[免费中文分词(文本处理)API 指南总目录](https://www.showapi.com/guides/cnseg-guides-2663)