Blog
Field notes on building AI in production.
Engineering write-ups, evaluation playbooks, and post-mortems from real engagements.
Evaluating LLM agents you can defend in a board meeting
A pragmatic evaluation framework for production LLM agents — beyond accuracy: groundedness, cost, latency, refusal quality, and incident response.