Quantum Leaps
← Research

LLM Security

Research into how language models fail, drift and expose users to risk. The work spans output validation, causal localization and adversarial evaluation.

Projects

01

OutputGuard

LLM output safety API. Validates model outputs before they reach users.

02

A-PRIME

Mechanistic interpretability. Causal localization of tool-call drift in Llama-3.1-8B.

03

AIAT

Adversarial red-teaming framework for LLM evaluation.