WONDERSEARCH / BENCHMARKS
We Measured
the Magic
See how WonderSearch compares with published sparse and dense retrieval results.
Small, Medium, and Large: internal benchmarks using the same harness as production, run on an NVIDIA H100. Ultra is an internal research configuration and is not currently available for public use.
THE RETRIEVAL LANDSCAPE
See where we land.
SciFact Public dataset
300 questions from the BEIR test set.
- WonderSearch 1.1 UltraResearch · Not currently available for public use80.3995% interval
76.75–83.99 - WonderSearch 1.1 LargeInternal · production harness · H10080.0695% interval
76.43–83.72 - Qwen/Qwen3-Embedding-8BDense · Published MTEB results78.46
- Qwen/Qwen3-Embedding-4BDense · Published MTEB results78.33
- WonderSearch 1.1 MediumInternal · production harness · H10077.7995% interval
73.98–81.71 - openai/text-embedding-3-largeDense · Published MTEB results77.77
- WonderSearch 1.1 SmallInternal · production harness · H10074.6895% interval
70.53–78.91 - BAAI/bge-large-en-v1.5Dense · Published MTEB results74.64
- thenlper/gte-largeDense · Published MTEB results74.27
- openai/text-embedding-3-smallDense · Published MTEB results73.37
- intfloat/e5-large-v2Dense · Published MTEB results72.24
- ELSER v2Sparse · Elastic, October 17, 202372.00
- intfloat/multilingual-e5-largeDense · Published MTEB results70.20
- DeepRetrieval-3B + BM25Sparse · DeepRetrieval, Table 2 (April 2025)64.60
- BAAI/bge-m3Dense · Published MTEB results64.37
Small, Medium, and Large use internal product-mode evaluations. Benchmarks were recorded using a copy of our production harness, and on a H100. Ultra uses research evaluation settings and is not currently available for public use. Other scores come from their linked publications. Lines on WonderSearch bars show 95% bootstrap intervals.