AI Site Reliability Engineer (AI SRE)
Job description
Purpose Ensure reliability, performance, and cost efficiency of AI services in production telco environments.
Key Responsibilities
Define and enforce SLIs/SLOs for AI services (latency, availability, accuracy) Monitor model drift, performance degradation, hallucination rates Manage incident response, root cause analysis, DR/HA Optimise cost-performance trade-offs (GPU usage, inference scaling) Ensure high availability for mission-critical use cases (fraud, network ops) Requirements SRE practices, observability (Open.
Telemetry, Datadog) Experience with high-scale distributed systems Knowledge of AI monitoring (drift, bias, inference metrics) Strong debugging and incident management skills Benefits Service uptime Mean time to recovery (MTTR) Cost vs performance efficiency