// blog
Practical, production-grounded notes on building AI and data systems.
A pragmatic walkthrough of building a production recommendation system with candidate generation, propensity ranking, a Kafka/Airflow/BigQuery pipeline, and metrics that track revenue, not just AUC.
A pragmatic guide to LLM observability in production: cost, tokens, latency percentiles, failure rates, groundedness, prompt versioning, tracing, evals as monitoring, and alerting.
Hard-won lessons from running a real-time third-party data platform on Kafka: partitioning, backpressure, exactly-once vs at-least-once, schema evolution, and circuit breakers.
A pragmatic guide to running multi-armed bandits in production: epsilon-greedy vs Thompson Sampling, delayed rewards, non-stationarity, guardrails, and wiring.