重排序模型对比
生产环境往往混用 cross-encoder、listwise 模型、late-interaction 以及指令式 API。2026 年最值得注意的一点是:参数量不再预测质量 —— 0.6B 的 listwise 模型(Jina v3)在 BEIR 上超过 Qwen3-Reranker-4B,149M 的 cross-encoder 在 Hit@1 上与 1.2B 打平,而 Qwen3 自己的 4B 也略胜 8B。下表对比架构、延迟、语言与成本,凡评测协议不一致处均如实标注。
| 模型 | 架构 | 类型 | 最适合 | 语言 | 典型延迟 50 条文档 | 价格 | BEIR NDCG@10 | 试用 |
|---|---|---|---|---|---|---|---|---|
| Qwen3-Reranker-4B | Cross-encoder | Apache 2.0Qwen3 最佳档位 | 多语言开源自托管最强(需 GPU) | 100+ langs · 32K ctx | GPU required | 免费(自建) | MTEB-R* | — |
| Qwen3-Reranker-8B | Cross-encoder | Apache 2.0 | Qwen3 最大档 —— 但 BEIR 上 4B 更好 | 100+ langs · 32K ctx | GPU / multi-GPU | 免费(自建) | MTEB-R* | — |
| Qwen3-Reranker-0.6B | Cross-encoder | Apache 2.0 | 最轻 Qwen3;舒适运行仍需 GPU | 100+ langs · 32K ctx | 建议 GPU | 免费(自建) | MTEB-R* | — |
| bge-reranker-v2-m3 | Cross-encoder | Open weights | 经过验证的自建默认;CPU 友好 | 100+ 种语言 | 200–500 ms CPU 20–50 ms GPU |
免费(自建) | ~60.1 | — |
| mxbai-rerank-large-v1 | Cross-encoder | Open weights Browser ✓ |
经典 BEIR 强;Demo 用 xsmall | 英文 | 150–400 ms CPU ~30 ms GPU |
免费(自建) | ~62.1 | |
| Jina Reranker v3 | Listwise | 开源 + 托管优于 Qwen3-4B | 0.6B listwise;64 篇文档共享 131K 上下文 | 100+ 种语言 | API or GPU self-host | 免费额度 + 按量付费 | 61.94 | — |
| jina-reranker v1 tiny | Cross-encoder | Open weights Browser ✓ |
浏览器 / 边缘;驱动本站 Demo | 英文 | 30–80 ms CPU (browser) | 免费(自建) | 旧版 tiny | |
| Cohere Rerank 4 Pro | Cross-encoder | Hosted API | 成熟的多语言 API;32k 上下文 | 100+ 种语言 | API | $0.0025/search† | not published* | — |
| Cohere Rerank 4 Fast | Cross-encoder | Hosted API | 面向吞吐与延迟调优的同系版本 | 100+ 种语言 | API | $0.002/search† | not published* | — |
| Voyage rerank-2.5 | Cross-encoder | Hosted APIInstruction | 支持指令跟随;32k 上下文 | 多语言 | API | $0.05/M tokens† | not published* | — |
| Voyage rerank-2.5-lite | Cross-encoder | Hosted API | 更便宜的档位;同样 32k 上下文 | 多语言 | API | $0.02/M tokens† | not published* | — |
| gte-reranker-modernbert-base | Cross-encoder | Open weightsCompact | 仅约 149M,Hit@1 却与 nemotron-1b 打平 | 英文 | Fast GPU / CPU-friendly | 免费(自建) | Hit@1 ≈ nemotron* | — |
| llama-nemotron-rerank-1b-v2 | Cross-encoder | Open + NIM API | 1.2B;在不计延迟时精度居首 | 多语言(MIRACL / MLQA 评测) | GPU / NIM | NIM / self-host | Hit@1 83.0* | — |
| ms-marco MiniLM-L6 (browser) | Cross-encoder | Open weights Browser ✓ |
经典基线;Demo 默认 | 英文 | 50–150 ms browser WASM | 免费(自建) | ~55.0 | |
| Contextual AI Rerank v2 | Instruction | Hosted API | 指令跟随 / 策略型相关性 | 英文 | API | Contact vendor† | 不适用 | — |
| ColBERTv2 | Late-interaction | Open weights | Token MaxSim;1.5 阶段而非完整 CE | 英文 | 大规模快速重打分 | 免费(自建) | 不适用 | — |
Qwen3-Reranker
0.6B / 4B / 8B,32K 上下文。从 4B 开始 —— 据报告它在 BEIR 上略胜 8B,所以「越大越好」在这里并不成立。
bge-reranker
智源开源权重。仍是 CPU 友好默认(v2-m3)。有 GPU 余量时与 Qwen3 对比。
Cohere Rerank 4
Pro 与 Fast 两个版本,32k 上下文,100+ 语言。按「次检索」计费 —— 一个 query 加最多 100 篇文档 —— 而不是按文档数。
Jina Reranker v3
0.6B 的 listwise 模型,BEIR 得分 61.94 —— 以约六分之一的体量超过 Qwen3-Reranker-4B。v1-tiny 仍在驱动我们的 Demo。
Voyage rerank-2.5
rerank-2.5 与 -lite,均为 32k 上下文并支持指令跟随,可以用自然语言引导相关性判断。按 token 计费。
mxbai-rerank
Apache 2.0 DeBERTa-v3 rerankers from mixedbread-ai. The xsmall variant runs in the browser and powers our demo.
Late-interaction(ColBERT)
ColBERTv2 何时胜过 bi-encoder、何时仍要 cross-encoder —— 2026 栈决策指南。
指令跟随 rerank
任务指令如何改变相关性 —— Contextual AI 类 vs 经典 cross-encoder。
如何选择
Qwen3-Reranker
多语言开源权重最优 —— 从 4B 起步
- 0.6B / 4B / 8B,全部 Apache 2.0,全部 32K 上下文
- 4B 是甜点档 —— 8B 更贵,分数却不更高
- 厂商给的是 MTEB-R 数字,请在你自己的标注集上复核
bge-reranker
GPU 有限时的最佳免费自建
- 零按次成本 —— 跑在你自己的基础设施上
- 强多语言质量(v2-m3 覆盖 100+ 种语言)
- 与
sentence-transformers、LangChain、LlamaIndex 即插即用
Cohere Rerank 4
最省事的托管 API;在 Pro 与 Fast 间二选一
- Python、Node、Java、Go 官方 SDK —— 一行代码接入
- 两个版本都是 32k 上下文、100+ 语言
- Pro 重精度,Fast 重吞吐 —— 每次检索 $0.0025 对 $0.002
Jina Reranker v3
单卡就能跑,BEIR 却在第一梯队
- 0.6B 拿到 61.94 BEIR nDCG@10 —— 胜过体量 6 倍的 Qwen3-Reranker-4B
- Listwise:64 篇文档共享同一个 131K token 的上下文
- v1-tiny 仍可在浏览器跑(本站 Demo)
Voyage rerank-2.5
可用指令引导相关性,按 token 计费
- 用自然语言指令引导打分,无需微调
- rerank-2.5 与更便宜的 -lite 都是 32k 上下文
- 每个账号前 2 亿 token 免费;走 Batch API 再打 67 折
mxbai-rerank
Apache 2.0 开源权重,浏览器可运行的 xsmall
- 宽松的 Apache 2.0 协议 —— 可商用、无限制
- xsmall 变体可在浏览器中运行(驱动本站实时 Demo)
- 大参数版本在本表中 BEIR 分数最高