Mcp-bench: Benchmarking tool-using llm agents with complex real-world tasks via mcp servers
Zhenting Wang, Qi Chang, Hemani Patel, et al.
Mcp-bench introduces a benchmark for evaluating tool-using LLM agents on complex real-world tasks via MCP servers, providing a standardized framework for assessing agent capabilities.