Never loop over 1M users in a request handler — fan out through a queue, throttle to what each provider can accept, make every send idempotent, and route failures to a DLQ for retry. The API call only enqueues; workers do the slow I/O.
Architecture
Admin ─▶ Campaign API ─▶ [enqueue job] ─▶ Kafka/SQS ─┐
▼
┌──────────────── Worker pool (autoscaled) ───────────────┐
│ claim ─▶ dedup(Redis SETNX) ─▶ rate-limiter ─▶ provider │
└──────────┬──────────────────────────────┬───────────────┘
│ ok │ fail (5xx/timeout)
▼ ▼
sent_log (DB) Retry (backoff) ─▶ DLQ
