印刷体OCR识别是免费接口,注册并拿到 AppKey 后即可调用,无需付费。
印刷体OCR识别指南总目录
本接口提供标准 OpenAPI 3.0 文档,覆盖全部接入点,可直接导入 API 工具做请求管理与 Mock。
本接口提供官方 MCP 服务,配置名 showapi-mcp-294,覆盖全部接入点,无需自己写 HTTP 封装。
多源新闻常出现"同一事件、不同标题正文"的同源稿,用相似度可把同题稿件聚成一簇,避免首页刷出 10 条一样的新闻。
用相似度把"重复灌水"量化:同一用户或同频道内,新内容对已有内容相似度 ≥ 阈值即疑似刷屏。
本接口是免费接口,但平台设统一档位限流:L0 100 次/天·1 QPS,最高 L4 50,000 次/天·50 QPS。优化目标是"在额度内办更多事"。
like / likeValue 是 0~1 的连续分值,阈值把"分值"翻译成"重复/不重复"的业务决策,是去重效果的核心旋钮。
本接口算法源于 Google 黑板报《数学之美(余弦定理和新闻分类)》,核心是把文本变成向量,用向量夹角余弦衡量相似度。
两个接入点均明确:不适用于英文和数字的检测。这是文档声明的语言限制,不是偶发故障。
接入点 2(294/2)是同步批量:一次请求传 1 个 t1 与一组候选 t2 数组,返回最匹配项的数组下标 mostLike 与相似度 likeValue。
去重本质是"两两相似度 ≥ 阈值则判定重复",核心在阈值设定与比对范围控制,不在接口本身。
接入点 1(294/1)返回 like;接入点 2(294/2)返回 likeValue + mostLike——两者字段名不同,切勿混用。
本接口基于余弦相似度,返回 0~1 的 like 值,越接近 1 两文本越相似。
中文文本相似度检测接口指南总目录



