{
  "version": 1,
  "provenance": {
    "source_urls": {
      "swebench_verified": "https://www.swebench.com/",
      "terminal_bench": "https://www.tbench.ai/leaderboard",
      "livecodebench": "https://livecodebench.github.io/leaderboard.html",
      "bfcl": "https://gorilla.cs.berkeley.edu/leaderboard.html"
    },
    "scrape_date": "2026-08-22",
    "catalog_freeze_date": "2026-08-22"
  },
  "aliases": {
    "anthropic/claude-opus-4": "claude-opus-4-5",
    "anthropic/claude-sonnet-4": "claude-sonnet-4-6",
    "claude-3-5-sonnet": "claude-sonnet-4-6",
    "claude-3-7-sonnet": "claude-sonnet-4-6",
    "claude-3-7-sonnet-latest": "claude-sonnet-4-6",
    "claude-3.5-sonnet": "claude-sonnet-4-6",
    "claude-3.5-sonnet-latest": "claude-sonnet-4-6",
    "claude-3.7-sonnet": "claude-sonnet-4-6",
    "claude-opus-4": "claude-opus-4-5",
    "claude-opus-4-1": "claude-opus-4-5",
    "claude-opus-4-20250514": "claude-opus-4-5",
    "claude-opus-4.1": "claude-opus-4-5",
    "claude-sonnet-4": "claude-sonnet-4-6",
    "claude-sonnet-4-20250514": "claude-sonnet-4-6",
    "claude-sonnet-4-5": "claude-sonnet-4-6",
    "claude-sonnet-4.5": "claude-sonnet-4-6",
    "composer-1": "gpt-5.3-codex",
    "composer-latest": "gpt-5.3-codex",
    "cursor/auto": "gpt-5.3-codex",
    "cursor/composer-latest": "gpt-5.3-codex",
    "default": "gpt-5.3-codex",
    "gemini-1.5-flash": "gemini-2.5-flash",
    "gemini-2.0-flash": "gemini-2.5-flash",
    "gemini-2.0-flash-001": "gemini-2.5-flash",
    "gemini-2.5-flash-002": "gemini-2.5-flash",
    "gemini-2.5-flash-lite": "gemini-2.5-flash",
    "gemini-2.5-flash-preview": "gemini-2.5-flash",
    "gemini-flash-8b": "gemini-2.5-flash",
    "gemini-flash-latest": "gemini-2.5-flash",
    "github-copilot/claude-3.5-sonnet": "claude-sonnet-4-6",
    "github-copilot/claude-sonnet-4": "claude-sonnet-4-6",
    "github-copilot/claude-sonnet-4.5": "claude-sonnet-4-6",
    "github-copilot/gemini-2.0-flash": "gemini-2.5-flash",
    "github-copilot/gemini-2.5-flash": "gemini-2.5-flash",
    "github-copilot/gpt-5": "gpt-5.3-codex",
    "github-copilot/gpt-5-codex": "gpt-5.3-codex",
    "google/gemini-2.5-flash": "gemini-2.5-flash",
    "gpt-5": "gpt-5.3-codex",
    "gpt-5-codex": "gpt-5.3-codex",
    "gpt-5.3": "gpt-5.3-codex",
    "gpt-5.5": "gpt-5.3-codex"
  },
  "models": [
    {
      "model_id": "claude-opus-4-5",
      "capabilities": {
        "reasoning": 0.7585,
        "code_gen": 0.708,
        "tool_use": 0.7498
      },
      "benchmark_sources": {
        "bfcl": {
          "raw_score": 77.47,
          "normalized": 0.7746999999999999
        },
        "livecodebench": {
          "raw_score": 62.4,
          "normalized": 0.624
        },
        "swebench_verified": {
          "raw_score": 79.2,
          "normalized": 0.792
        },
        "terminal_bench": {
          "raw_score": 72.5,
          "normalized": 0.725
        }
      }
    },
    {
      "model_id": "claude-sonnet-4-6",
      "capabilities": {
        "reasoning": 0.724,
        "code_gen": 0.681,
        "tool_use": 0.7062
      },
      "benchmark_sources": {
        "bfcl": {
          "raw_score": 73.24,
          "normalized": 0.7323999999999999
        },
        "livecodebench": {
          "raw_score": 59.4,
          "normalized": 0.594
        },
        "swebench_verified": {
          "raw_score": 76.8,
          "normalized": 0.768
        },
        "terminal_bench": {
          "raw_score": 68,
          "normalized": 0.68
        }
      }
    },
    {
      "model_id": "gemini-2.5-flash",
      "capabilities": {
        "reasoning": 0.3827,
        "code_gen": 0.5192,
        "tool_use": 0.5202
      },
      "benchmark_sources": {
        "bfcl": {
          "raw_score": 56.24,
          "normalized": 0.5624
        },
        "livecodebench": {
          "raw_score": 75.1,
          "normalized": 0.7509999999999999
        },
        "swebench_verified": {
          "raw_score": 28.73,
          "normalized": 0.2873
        },
        "terminal_bench": {
          "raw_score": 47.8,
          "normalized": 0.478
        }
      }
    },
    {
      "model_id": "gpt-5.3-codex",
      "capabilities": {
        "reasoning": 0.743,
        "code_gen": 0.744,
        "tool_use": 0.742
      },
      "benchmark_sources": {
        "swebench_verified": {
          "raw_score": 74.4,
          "normalized": 0.7440000000000001
        },
        "terminal_bench": {
          "raw_score": 74.2,
          "normalized": 0.742
        }
      }
    }
  ]
}
