哪种 reranker 适合你的场景?

决策指南 · 约 8 分钟阅读 ·

reranker 并非一刀切。正确选择取决于语言覆盖延迟预算数据敏感度,以及你的查询更像客服工单法律条款代码检索还是RAG 分块

场景矩阵

场景典型难点起步推荐运行位置
RAG 流水线 向量召回噪声大,需要 top-5 精度 bge-reranker-v2-m3(自托管)或 Cohere Rerank(API) 你的 GPU / 托管 API
客服工单 大量相似 FAQ,要求快速响应 jina-reranker tinyCohere 免费档 API 或浏览器 Demo
法律 / 合同 措辞细微,干扰项共享词汇 mxbai-rerank-largeVoyage 法律微调 自托管 / API
代码与 API 文档 精确标识符与语法很重要 Voyage code 或混合 BM25 + bge 混合检索 + 重排序

RAG 与知识库

召回 50–100 个 chunk,重排至 5–10 条再进 prompt。多语言知识库倾向 bge-v2-m3Cohere v3.5;仅英文且质量要求高常选 mxbai-large。词面匹配重要时见 为 RAG 加重排序混合检索

经验法则:bi-encoder 召回已经够好,中等 reranker 即可;召回很乱时,先加宽检索。

客服工单

查询短、段落 FAQ 体量、延迟主导体验。tiny cross-encoder(Jina tiny、ms-marco MiniLM)往往够用 —— 你是在若干相似答案里选,不是读百页 PDF。可在 Demo客服工单 预设。

干扰项共享词汇(「终止」「通知期」「违约」)。bi-encoder 易混淆;cross-encoder 能区分细微差别。为大模型预留额外延迟,段落保持单条款粒度。Demo 预设:法律条款

代码与技术文档

纯向量检索会漏精确函数名;纯 BM25 会漏「我该如何…」类改写。用混合检索再 rerank。领域 reranker(Voyage code)有帮助;否则 bge-base + 合理分块也行。Demo 预设:技术文档代码检索

在 Demo 中试用

下列场景对应内置预设 —— 载入后点重排序,看 bi-encoder 代理列先排错,再由 cross-encoder 纠正。

还在犹豫?

并排对比五大模型家族,一键跳进 Demo。

对比模型 →

继续阅读