Five prompts per language is enough for an instrument, not for strong claims. Gaps below ~0.05 SPI between models are run-to-run noise.
Planned for v2:
- Versioned, expanded dataset with schema validation.
Part of the CANYON v2 methodology roadmap — known weaknesses published openly.
Five prompts per language is enough for an instrument, not for strong claims. Gaps below ~0.05 SPI between models are run-to-run noise.
Planned for v2:
Part of the CANYON v2 methodology roadmap — known weaknesses published openly.