AI quality and software-engineering evaluation
AI evaluation systems
I built structured evaluation loops for software-engineering outputs, combining prompt design, rubrics, red teaming, and code-level verification while keeping client identities confidential.
RoleAI Training and RLHF Specialist
18% fewer recurring hallucination patternsmeasured outcome
1,248 samples reviewedmeasured outcome
Failure modes mappedmeasured outcome
What I owned
Created evaluation rubrics that made correctness, reliability, and reasoning quality measurable.
Mapped recurring hallucination patterns and fed the findings back into training and review loops.
Worked across Mindrift, AfterQuery, Scale AI, and Micro1 training environments.
For hiring teams
Have a hard problem?
Let's talk.
For senior engineering, platform, AI quality, or technical founding opportunities, I'd love to hear what you're building.
Book 15 minutes ↗