AERIC
Monitoring hidden-state shifts for implicit harmful dialogue.
AERIC studies whether changes in a model’s hidden state can signal risk before a conversation becomes explicitly harmful. The project focuses on anticipatory safety evaluation for dialogue systems.
Focus
- Hidden-state monitoring for implicit harmfulness.
- Conversation-level risk measurement.
- Evaluation workflows for safer LLM assistants.