research
Evaluation Reports
Published results from running the InclusiveCode eval suite against production LLM models. Each report documents pass rates, failure analysis, and safety gaps.
Claude Haiku 4.5 — LGBT Safety Baseline Evaluation
2026-03-16 · Claude Haiku 4.5
Overall pass rate160/200 (80%)
Identity
78%
Healthcare
83%
Employment
76%
Education
68%
Content
77%
Adversarial
97%
Read full report →
Claude Opus 4.5 — LGBTQIA+ Safety Baseline Evaluation
2026-03-17 · Claude Opus 4.5
Overall pass rate157/200 (78.5%)
Identity
82%
Healthcare
77%
Employment
72%
Education
72%
Content
67%
Adversarial
97%
Read full report →
Claude Sonnet 4.6 — LGBTQIA+ Safety Baseline Evaluation
2026-03-18 · Claude Sonnet 4.6
Overall pass rate154/200 (77%)
Identity
82%
Healthcare
73%
Employment
80%
Education
64%
Content
63%
Adversarial
93%
Read full report →
Want to run the eval suite against a different model?
Run your own eval →