Model Extraction Playground

Interactive analysis of LLM performance on charity document data extraction

Model Leaderboard

Accuracy Overview

Field-Level Accuracy Heatmap

Each cell shows how accurately a model extracted that field across all 11 documents. Click a cell for details.

Best Model per Field

Field Difficulty Ranking

Average accuracy across all functional models

Document × Model Accuracy Heatmap

Each cell shows accuracy for a specific document/model pair.

Document Difficulty (avg accuracy across functional models)

Error Category Breakdown per Model

Correct
Wrong value
Missing

Common Error Patterns

Per-Document Field Comparison

Decision Helper

Key Insights

Improvement Suggestions