技术博客
免费中文分词(文本处理):自动提取文章关键词与摘要(关键词/短语/摘要抽取实战)

免费中文分词(文本处理):自动提取文章关键词与摘要(关键词/短语/摘要抽取实战)

作者: 万维易源
2026-09-03
免费中文分词文本处理中文NLPAPI教程ShowAPI
# 免费中文分词(文本处理):自动提取文章关键词与摘要(关键词/短语/摘要抽取实战) > 接口:短语提取(2663-5) / 关键词抽取(2663-6) / 摘要抽取(2663-7)|是否免费:是(含档位限制)|返回格式:JSON|适用人群:内容运营、编辑、爬虫开发者|阅读时间:约 7 分钟 ## 核心要点 - 三个「抽取」接入点都吃一段 `text`,返回字符串数组 `list`:短语、关键词、摘要。 - 数量可用参数控制:短语用 `size`、关键词/摘要用 `num`(均为可选)。 - 三者组合可构成「长文 → 标签 + 导语」的内容预处理流水线。 ## Why 公众号、资讯流、知识库每天产生大量长文,人肉提炼关键词和摘要既慢又不稳定。把这三件套接上,文章一发进来就自动产出标签和导语,直接进数据库、进推荐位。对内容平台来说,这是性价比最高的结构化第一步。 ## What **接口速览** | 接入点 | 路径 | 必填 | 可选(数量) | 返回 | |------|------|------|------------|------| | 短语提取 | 2663-5 | `text` | `size`(短语个数) | `list`: [String] | | 关键词抽取 | 2663-6 | `text` | `num`(关键词个数) | `list`: [String] | | 摘要抽取 | 2663-7 | `text` | `num`(摘要条数) | `list`: [String] | ## How 一篇长文同时抽关键词和摘要: ```python import requests APPKEY = "YOUR_APPKEY" BASE = "https://route.showapi.com/2663-" def extract(path, text, **extra): resp = requests.post(BASE + path, params={"appKey": APPKEY}, data={"text": text, **extra}, timeout=10).json() body = resp["showapi_res_body"] if body.get("ret_code") != 0: raise RuntimeError(body.get("remark")) return body.get("list", []) article = "中文分词是自然语言处理的基础任务……(你的长文)" keywords = extract("6", article, num=5) # 抽 5 个关键词 summary = extract("7", article, num=3) # 抽 3 句摘要 phrases = extract("5", article, size=8) # 抽 8 个短语 print("关键词:", keywords) print("摘要:", summary) print("短语:", phrases) ``` **cURL(关键词抽取)** ```bash curl -X POST "https://route.showapi.com/2663-6?appKey=YOUR_APPKEY" \ -H "content-type: application/x-www-form-urlencoded" \ --data-urlencode "text=中文分词是自然语言处理的基础任务之一" \ --data-urlencode "num=5" ``` ## 返回示例与解析 关键词抽取(2663-6)返回: ```json { "showapi_res_body": { "ret_code": 0, "remark": "成功", "list": ["中文分词", "自然语言处理", "基础任务"] } } ``` - `list` 是抽取结果的字符串数组,顺序通常按权重/相关度排列。 - `num` / `size` 不传时使用后端默认值;传了则尽量按数量返回(实际条数可能少于请求值)。 ## 进阶 / 边界 - **组合成标签流水线**:关键词做标签、摘要做导语、短语做补充说明,三者结果可合并入内容元数据。 - **数量参数不是硬保证**:`num`/`size` 是「期望数量」,返回可能更少,前端要做缺省处理。 - **免费档空结果**:默认档位可能返回空 `list`,见 [免费档位与调用策略](https://www.showapi.com/guides/cnseg-free-tier-2663)。 ## FAQ **Q1:短语、关键词、摘要三个接口返回结构一样吗?** 都是 `list` 字符串数组,结构一致,仅语义不同;差别在可选数量参数名(短语用 `size`,其余用 `num`)。 **Q2:num 传很大能拿更多结果吗?** 后端有自身上限,超出的部分不会无限返回;按业务需要取合理值即可。 **Q3:摘要抽取返回的是整段还是句子?** 返回的是句子组成的数组,可自行拼接成导语。 **Q4:免费档返回空 list 是失败吗?** 通常不是,多为档位限制,先核对额度。 **Q5:这三个能一次调用吗?** 需分别调用 2663-5/6/7,上面示例已串联。 ## 相关能力 / 下一步阅读 - [免费中文分词(文本处理):如何用接口做人名/地名/机构名识别(NER 实战)](https://www.showapi.com/guides/cnseg-ner-2663) - [免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线](https://www.showapi.com/guides/cnseg-tagging-2663) - [免费中文分词(文本处理):返回结构与公共字段全解](https://www.showapi.com/guides/cnseg-response-2663) > 本系列共 14 篇:查看[免费中文分词(文本处理)API 指南总目录](https://www.showapi.com/guides/cnseg-guides-2663)