What to Log in AI Agents: Observability, Tool Calls, Errors, and Cost Guide
Learn how to track AI agent tool executions, MCP calls, approval decisions, token usage, errors, and costs with privacy-first observability.

- Audience
- Developer
- Content type
- Technical security guide
Short answer
Deploying autonomous AI agents, LLM function calling, and RAG pipelines in production introduces operational challenges: non-deterministic outputs, API latency spikes, unexpected token cost inflation, and hidden prompt failures.
Traditional application logging (capturing HTTP 500 errors or database exceptions) is insufficient for AI systems. You must implement **AI Observability** to capture prompt inputs, completion outputs, token usage counts, latency breakdowns, and vector retrieval scores.
AI Agent Observability Architecture:
System Application Logs (Winston / Pino) + LLM Execution Tracing (LangSmith / Helicone / OpenTelemetry) + Token & Cost Allocation Dashboards + Prompt Versioning & Evaluation Metrics =
Full AI Observability
Key Observability Metrics for AI Agents:
1. Implementing OpenTelemetry and Tracing for AI
Use open observability standards like OpenTelemetry or dedicated AI observability platforms (LangSmith, Helicone, Phoenix) to trace agent tool calls:
- Assign unique `trace_id` to every user session.
- Log exact prompt inputs, system instructions, and raw LLM completions.
- Mask sensitive PII (emails, API keys) before logging payloads.
AI Observability Checklist
- [ ] Track token consumption per user, session, and prompt template
- [ ] Log LLM execution latency and tool-calling execution steps
- [ ] Sanitize PII and sensitive user input from raw prompt logs
- [ ] Set up automated cost alerts when daily token budgets exceed thresholds
Sources
- OpenTelemetry Documentation — Tracing and Metrics Specifications
- NIST SP 800-92 — Guide to Computer Security Log Management