RANK.AI DATA / LATEST PUBLICATION

BFCL tool use configurations

109 models ranked by BFCL overall accuracy.
Claude-Opus-4-5-20251101 (FC) is out in front at 77.47%.

109 modelschecked Apr 13, 2026, 11:59 PM UTCdailyhow we measure this →CSV / JSON

Follow changes
In front today

Claude-Opus-4-5-20251101 (FC)

77.47%BFCL overall accuracy

Ahead of second place
4.2%
Held by the top three
5%
Middle of the board
35.5%
Below half the leader
64 of 109
Highest 77.47%Middle 35.5%
1. Claude-Opus-4-5-20251101 (FC) — 77.47%2. Claude-Sonnet-4-5-20250929 (FC) — 73.24%3. Gemini-3-Pro-Preview (Prompt) — 72.51%4. GLM-4.6 (FC thinking) — 72.38%5. Grok-4-1-fast-reasoning (FC) — 69.57%6. Claude-Haiku-4-5-20251001 (FC) — 68.70%7. Gemini-3-Pro-Preview (FC) — 68.14%8. o3-2025-04-16 (Prompt) — 63.05%9. Grok-4-0709 (Prompt) — 62.97%10. Grok-4-0709 (FC) — 61.38%11. Moonshotai-Kimi-K2-Instruct (FC) — 59.06%12. Grok-4-1-fast-non-reasoning (FC) — 58.29%13. Command A Reasoning (FC) — 57.06%14. DeepSeek-V3.2-Exp (Prompt + Thinking) — 56.73%15. Gemini-2.5-Flash (FC) — 56.24%16. GPT-5.2-2025-12-11 (FC) — 55.87%17. GPT-5-mini-2025-08-07 (FC) — 55.46%18. xLAM-2-32b-fc-r (FC) — 54.66%19. DeepSeek-V3.2-Exp (FC) — 54.12%20. GPT-4.1-2025-04-14 (FC) — 53.96%21. o4-mini-2025-04-16 (FC) — 53.24%22. xLAM-2-70b-fc-r (FC) — 53.07%23. Qwen3-235B-A22B-Instruct-2507 (Prompt) — 52.15%24. GPT-5-nano-2025-08-07 (FC) — 51.45%25. Nanbeige4-3B-Thinking-2511 (FC) — 51.40%26. Gemini-2.5-Flash (Prompt) — 50.90%27. GPT-4.1-mini-2025-04-14 (FC) — 50.45%28. o4-mini-2025-04-16 (Prompt) — 50.26%29. Qwen3-32B (FC) — 48.71%30. o3-2025-04-16 (FC) — 48.56%31. Qwen3-235B-A22B-Instruct-2507 (FC) — 47.99%32. Nanbeige3.5-Pro-Thinking (FC) — 47.68%33. Qwen3-32B (Prompt) — 46.78%34. xLAM-2-8b-fc-r (FC) — 46.68%35. Command A (FC) — 46.49%36. BitAgent-Bounty-8B — 46.23%37. Arch-Agent-32B — 45.37%38. GPT-5.2-2025-12-11 (Prompt) — 45.27%39. Qwen3-8B (FC) — 42.57%40. ToolACE-2-8B (FC) — 42.44%41. Qwen3-30B-A3B-Instruct-2507 (FC) — 41.39%42. xLAM-2-3b-fc-r (FC) — 41.22%43. Qwen3-14B (FC) — 41.03%44. Qwen3-8B (Prompt) — 40.43%45. GPT-4.1-2025-04-14 (Prompt) — 39.38%46. mistral-large-2411 (FC) — 38.37%47. Qwen3-14B (Prompt) — 37.77%48. Mistral-Medium-2505 — 37.69%49. Mistral-Medium-2505 (FC) — 37.56%50. Llama-4-Maverick-17B-128E-Instruct-FP8 (FC) — 37.29%51. Mistral-small-2506 (FC) — 37.15%52. Gemini-2.5-Flash-Lite (FC) — 36.87%53. Qwen3-30B-A3B-Instruct-2507 (Prompt) — 36.70%54. Qwen3-4B-Instruct-2507 (FC) — 35.68%55. Qwen3-4B-Instruct-2507 (Prompt) — 35.52%56. Arch-Agent-3B — 35.36%57. Claude-Opus-4-5-20251101 (Prompt) — 33.47%58. GPT-4.1-nano-2025-04-14 (FC) — 33.05%59. Mistral-Small-2506 (Prompt) — 32.38%60. Arch-Agent-1.5B — 32.14%61. Command R7B (FC) — 32.07%62. Llama-3.3-70B-Instruct (FC) — 31.90%63. mistral-large-2411 (Prompt) — 31.84%64. Hammer2.1-7b (FC) — 31.67%65. xLAM-2-1b-fc-r (FC) — 30.44%66. Gemma-3-12b-it (Prompt) — 30.43%67. GPT-4.1-mini-2025-04-14 (Prompt) — 29.73%68. Hammer2.1-3b (FC) — 29.71%69. Gemma-3-27b-it (Prompt) — 29.47%70. Phi-4 (Prompt) — 28.79%71. Qwen3-1.7B (FC) — 28.41%72. Llama-4-Scout-17B-16E-Instruct (FC) — 28.13%73. Gemini-2.5-Flash-Lite (Prompt) — 28.03%74. CoALM-70B — 27.99%75. Hammer2.1-1.5b (FC) — 27.88%76. palmyra-x-004 (FC) — 27.87%77. GPT-5-mini-2025-08-07 (Prompt) — 27.83%78. Open-Mistral-Nemo-2407 (FC) — 27.63%79. GPT-5-nano-2025-08-07 (Prompt) — 27.55%80. Amazon-Nova-2-Lite-v1:0 (FC) — 27.10%81. Granite-3.1-8B-Instruct (FC) — 27.10%82. Falcon3-10B-Instruct (FC) — 27.01%83. Granite-3.2-8B-Instruct (FC) — 26.87%84. CoALM-8B — 26.81%85. Llama-3.1-8B-Instruct (Prompt) — 25.83%86. MiniCPM3-4B-FC (FC) — 25.55%87. Claude-Haiku-4-5-20251001 (Prompt) — 25.26%88. Amazon-Nova-Pro-v1:0 (FC) — 24.97%89. Claude-Sonnet-4-5-20250929 (Prompt) — 24.90%90. GPT-4.1-nano-2025-04-14 (Prompt) — 24.88%91. Falcon3-7B-Instruct (FC) — 24.03%92. Qwen3-0.6B (FC) — 23.93%93. Granite-20b-FunctionCalling (FC) — 23.23%94. Qwen3-0.6B (Prompt) — 22.38%95. Amazon-Nova-Micro-v1:0 (FC) — 22.29%96. RZN-T (Prompt) — 22.25%97. MiniCPM3-4B (Prompt) — 22.08%98. Llama-3.2-3B-Instruct (FC) — 21.95%99. Bielik-11B-v2.3-Instruct (Prompt) — 21.90%100. Hammer2.1-0.5b (FC) — 21.22%101. Gemma-3-4b-it (Prompt) — 19.62%102. Open-Mistral-Nemo-2407 (Prompt) — 19.31%103. Granite-4.0-350m (FC) — 18.98%104. Falcon3-3B-Instruct (FC) — 16.25%105. Ministral-8B-Instruct-2410 (FC) — 11.10%106. Falcon3-1B-Instruct (FC) — 11.08%107. Llama-3.2-1B-Instruct (FC) — 10.82%108. Llama-3.1-Nemotron-Ultra-253B-v1 (FC) — 10.00%109. Gemma-3-1b-it (Prompt) — 7.17%
Rank 1one bar per published rowRank 109
WHY THIS RANK / VERIFIED SNAPSHOT

Amazon-Nova-2-Lite-v1:0 (FC)

Ranks exact model-plus-inference configurations by official UC Berkeley BFCL overall accuracy.

Some explanation inputs are unavailable Missing: publicFrozenEvidence, comparablePriorRanking.

Published rank
#80
Score
27.1 percent
Sample size
11

100% confidence · 58% component coverage · as of Apr 13, 2026, 11:59 PM UTC

SCORE CONSTRUCTION

Component ledger

11/19 evidenced
Components contributing to Amazon-Nova-2-Lite-v1:0 (FC)'s rank
ComponentValueWeightContributionEvidenceStatus
benchmarkVersionv4Unavailable0unavailableno_public_frozen_evidence
bfcl evaluation total cost USD0%01available
bfcl irrelevance detection accuracy0%01available
bfcl latency mean seconds0%01available
bfcl latency p95 seconds0%01available
bfcl live accuracy0%01available
bfcl memory accuracy0%01available
bfcl multi turn accuracy0%01available
bfcl non live ast accuracy0%01available
bfcl overall accuracy100%27.11available
bfcl relevance detection accuracy0%01available
bfcl web search accuracy0%01available
interactionModeFCUnavailable0unavailableno_public_frozen_evidence
metricsStructuredUnavailable0unavailableno_public_frozen_evidence
organizationAmazonUnavailable0unavailableno_public_frozen_evidence
rankingDirectiondescendingUnavailable0unavailableno_public_frozen_evidence
reviewedAsOf2026-04-13Unavailable0unavailableno_public_frozen_evidence
sourceConfigurationAmazon-Nova-2-Lite-v1:0 (FC)Unavailable0unavailableno_public_frozen_evidence
upstreamRank80Unavailable800unavailableno_public_frozen_evidence
WHY IT MOVED

new since prior snapshot

No rank delta

no_prior_published_snapshot

No component moved since the prior snapshot.

PRIMARY EVIDENCE

Source trail

11 public records
  • BFCL evaluation total costbfcl evaluation total cost USD · observed Apr 13, 2026, 11:59 PM UTC$78.19100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL irrelevance-detection accuracybfcl irrelevance detection accuracy · observed Apr 13, 2026, 11:59 PM UTC82.11 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL mean latencybfcl latency mean seconds · observed Apr 13, 2026, 11:59 PM UTC8.55 seconds100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL p95 latencybfcl latency p95 seconds · observed Apr 13, 2026, 11:59 PM UTC27.62 seconds100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL live accuracybfcl live accuracy · observed Apr 13, 2026, 11:59 PM UTC80.83 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL memory accuracybfcl memory accuracy · observed Apr 13, 2026, 11:59 PM UTC2.37 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL multi-turn accuracybfcl multi turn accuracy · observed Apr 13, 2026, 11:59 PM UTC2.12 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL non-live AST accuracybfcl non live ast accuracy · observed Apr 13, 2026, 11:59 PM UTC86.96 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL overall accuracybfcl overall accuracy · observed Apr 13, 2026, 11:59 PM UTC27.1 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL relevance-detection accuracybfcl relevance detection accuracy · observed Apr 13, 2026, 11:59 PM UTC75 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
  • BFCL web-search accuracybfcl web search accuracy · observed Apr 13, 2026, 11:59 PM UTC5 percent100% confidence
    Source
    Berkeley Function Calling Leaderboard
    Grade
    A
    Freshness
    fresh
    Locator
    {"csv":"https://gorilla.cs.berkeley.edu/data_overall.csv","repository":"https://github.com/ShishirPatil/gorilla/tree/main/berkeley-function-call-leaderboard","leaderboard":"https://gorilla.cs.berkeley.edu/leaderboard.html","rowIdentity":"Model","rankingColumn":"Overall Acc"}
    Open primary evidence ↗
REPRODUCIBILITYBFCL v4 tool-use configuration ranking reviewed 2026-04-13 · vbfcl-v4-2026-04-13-official-v1-bfcl-tool-use-configurations-v11,279 observations · 1 sources · passed quality
Snapshot
57524365-34d0-45a4-bbfa-4142294a674f
Data hash
fd7246bbd83f6cd45af19278b9c0ca93e6d1a34d38d56f10f93c35e7191b50b2
Method hash
be8373dfcda076297ac4e7e0c7a03a647edcca8bedd8d06fb7a07d005a5326d6

More in Model rank

Capability-first rankings across frontier and open models.

3 live tables
Arena text preference

Official style-controlled text human-preference ratings with confidence bounds, variance, vote counts, and a frozen dataset revision.