免费中文分词(文本处理):自动提取文章关键词与摘要(关键词/短语/摘要抽取实战)
免费中文分词文本处理中文NLPAPI教程ShowAPI # 免费中文分词(文本处理):自动提取文章关键词与摘要(关键词/短语/摘要抽取实战)
> 接口:短语提取(2663-5) / 关键词抽取(2663-6) / 摘要抽取(2663-7)|是否免费:是(含档位限制)|返回格式:JSON|适用人群:内容运营、编辑、爬虫开发者|阅读时间:约 7 分钟
## 核心要点
- 三个「抽取」接入点都吃一段 `text`,返回字符串数组 `list`:短语、关键词、摘要。
- 数量可用参数控制:短语用 `size`、关键词/摘要用 `num`(均为可选)。
- 三者组合可构成「长文 → 标签 + 导语」的内容预处理流水线。
## Why
公众号、资讯流、知识库每天产生大量长文,人肉提炼关键词和摘要既慢又不稳定。把这三件套接上,文章一发进来就自动产出标签和导语,直接进数据库、进推荐位。对内容平台来说,这是性价比最高的结构化第一步。
## What
**接口速览**
| 接入点 | 路径 | 必填 | 可选(数量) | 返回 |
|------|------|------|------------|------|
| 短语提取 | 2663-5 | `text` | `size`(短语个数) | `list`: [String] |
| 关键词抽取 | 2663-6 | `text` | `num`(关键词个数) | `list`: [String] |
| 摘要抽取 | 2663-7 | `text` | `num`(摘要条数) | `list`: [String] |
## How
一篇长文同时抽关键词和摘要:
```python
import requests
APPKEY = "YOUR_APPKEY"
BASE = "https://route.showapi.com/2663-"
def extract(path, text, **extra):
resp = requests.post(BASE + path, params={"appKey": APPKEY},
data={"text": text, **extra}, timeout=10).json()
body = resp["showapi_res_body"]
if body.get("ret_code") != 0:
raise RuntimeError(body.get("remark"))
return body.get("list", [])
article = "中文分词是自然语言处理的基础任务……(你的长文)"
keywords = extract("6", article, num=5) # 抽 5 个关键词
summary = extract("7", article, num=3) # 抽 3 句摘要
phrases = extract("5", article, size=8) # 抽 8 个短语
print("关键词:", keywords)
print("摘要:", summary)
print("短语:", phrases)
```
**cURL(关键词抽取)**
```bash
curl -X POST "https://route.showapi.com/2663-6?appKey=YOUR_APPKEY" \
-H "content-type: application/x-www-form-urlencoded" \
--data-urlencode "text=中文分词是自然语言处理的基础任务之一" \
--data-urlencode "num=5"
```
## 返回示例与解析
关键词抽取(2663-6)返回:
```json
{
"showapi_res_body": {
"ret_code": 0,
"remark": "成功",
"list": ["中文分词", "自然语言处理", "基础任务"]
}
}
```
- `list` 是抽取结果的字符串数组,顺序通常按权重/相关度排列。
- `num` / `size` 不传时使用后端默认值;传了则尽量按数量返回(实际条数可能少于请求值)。
## 进阶 / 边界
- **组合成标签流水线**:关键词做标签、摘要做导语、短语做补充说明,三者结果可合并入内容元数据。
- **数量参数不是硬保证**:`num`/`size` 是「期望数量」,返回可能更少,前端要做缺省处理。
- **免费档空结果**:默认档位可能返回空 `list`,见 [免费档位与调用策略](https://www.showapi.com/guides/cnseg-free-tier-2663)。
## FAQ
**Q1:短语、关键词、摘要三个接口返回结构一样吗?**
都是 `list` 字符串数组,结构一致,仅语义不同;差别在可选数量参数名(短语用 `size`,其余用 `num`)。
**Q2:num 传很大能拿更多结果吗?**
后端有自身上限,超出的部分不会无限返回;按业务需要取合理值即可。
**Q3:摘要抽取返回的是整段还是句子?**
返回的是句子组成的数组,可自行拼接成导语。
**Q4:免费档返回空 list 是失败吗?**
通常不是,多为档位限制,先核对额度。
**Q5:这三个能一次调用吗?**
需分别调用 2663-5/6/7,上面示例已串联。
## 相关能力 / 下一步阅读
- [免费中文分词(文本处理):如何用接口做人名/地名/机构名识别(NER 实战)](https://www.showapi.com/guides/cnseg-ner-2663)
- [免费中文分词(文本处理):内容平台自动化打标签——NER + 关键词抽取的标签流水线](https://www.showapi.com/guides/cnseg-tagging-2663)
- [免费中文分词(文本处理):返回结构与公共字段全解](https://www.showapi.com/guides/cnseg-response-2663)
> 本系列共 14 篇:查看[免费中文分词(文本处理)API 指南总目录](https://www.showapi.com/guides/cnseg-guides-2663)