AERIC

Monitoring hidden-state shifts for implicit harmful dialogue.

AERIC studies whether changes in a model’s hidden state can signal risk before a conversation becomes explicitly harmful. The project focuses on anticipatory safety evaluation for dialogue systems.

Focus

  • Hidden-state monitoring for implicit harmfulness.
  • Conversation-level risk measurement.
  • Evaluation workflows for safer LLM assistants.