Open benchmark for operational alignment under explicit policy across model checkpoints, agents and trajectories.
open-source benchmark model-evaluation ai-safety reflex ai-agents checkpoints ai-alignment llm-evaluation agent-evaluation alignment-benchmark brida operational-alignment
-
Updated
Sep 23, 2026 - Python