Wandr Benchmark: Evaluating Research Agents That Must Search Wide and Deep
research.perplexity.ai
Wandr Benchmark: Evaluating Research Agents That Must Search Wide and Deep
1–2 of 2 posts
Re: Wandr Benchmark: Evaluating Research Agents That Must Search Wide and Deep
#2Repo with benchmark tasks, evaluation harness, tech report: