Rate limiting server को बहुत अधिक requests से बचाता है; HTTP caching उन requests के लिए काम दोहराने से बचाता है जिनका वह पहले ही उत्तर दे चुका है। दोनों HTTP में standardized हैं और दोनों बड़े पैमाने पर एक production API के लिए आवश्यक हैं।
Rate limiting
Server सीमित करता है कि एक client प्रति window कितनी requests कर सकता है और सीमा पार होने पर 429 Too Many Requests लौटाता है। यह headers के ज़रिए सीमाओं का विज्ञापन करता है ताकि एक अच्छे व्यवहार वाला client खुद को self-throttle कर सके:
HTTP/1.1 200 OK
RateLimit-Limit: 100
RateLimit-Remaining: 12
RateLimit-Reset: 30
