Agentic evaluation of misalignment, scheming and evaluation awareness in LLM agents. Scenario text encoded at rest to resist training-data contamination.
python benchmark model-evaluation ai-safety ai-agents ai-alignment llm llm-evaluation scheming evaluation-awareness
-
Updated
Aug 31, 2026 - Python