哪种 reranker 适合你的场景?
reranker 并非一刀切。正确选择取决于语言覆盖、延迟预算、数据敏感度,以及你的查询更像客服工单、法律条款、代码检索还是RAG 分块。
场景矩阵
| 场景 | 典型难点 | 起步推荐 | 运行位置 |
|---|---|---|---|
| RAG 流水线 | 向量召回噪声大,需要 top-5 精度 | bge-reranker-v2-m3(自托管)或 Cohere Rerank(API) | 你的 GPU / 托管 API |
| 客服工单 | 大量相似 FAQ,要求快速响应 | jina-reranker tiny 或 Cohere 免费档 | API 或浏览器 Demo |
| 法律 / 合同 | 措辞细微,干扰项共享词汇 | mxbai-rerank-large 或 Voyage 法律微调 | 自托管 / API |
| 代码与 API 文档 | 精确标识符与语法很重要 | Voyage code 或混合 BM25 + bge | 混合检索 + 重排序 |
RAG 与知识库
召回 50–100 个 chunk,重排至 5–10 条再进 prompt。多语言知识库倾向 bge-v2-m3 或 Cohere v3.5;仅英文且质量要求高常选 mxbai-large。词面匹配重要时见 为 RAG 加重排序 与 混合检索。
经验法则:bi-encoder 召回已经够好,中等 reranker 即可;召回很乱时,先加宽检索。
客服工单
查询短、段落 FAQ 体量、延迟主导体验。tiny cross-encoder(Jina tiny、ms-marco MiniLM)往往够用 —— 你是在若干相似答案里选,不是读百页 PDF。可在 Demo 试 客服工单 预设。
法律与合规
干扰项共享词汇(「终止」「通知期」「违约」)。bi-encoder 易混淆;cross-encoder 能区分细微差别。为大模型预留额外延迟,段落保持单条款粒度。Demo 预设:法律条款。
代码与技术文档
纯向量检索会漏精确函数名;纯 BM25 会漏「我该如何…」类改写。用混合检索再 rerank。领域 reranker(Voyage code)有帮助;否则 bge-base + 合理分块也行。Demo 预设:技术文档、代码检索。
在 Demo 中试用
下列场景对应内置预设 —— 载入后点重排序,看 bi-encoder 代理列先排错,再由 cross-encoder 纠正。