Reserve before dispatch. Reconcile after response.
Hard token limits enforced at the transport layer. Priority admission (critical / default / background) with starvation prevention keeps latency-sensitive calls flowing while background work waits its turn.
from openai import OpenAI
from backstop import Backstop
client = Backstop.wrap(OpenAI(), budget=50_000)
# Use the client exactly as before —
# Backstop intercepts at the transport layer.
response = client.chat.completions.create(
model="gpt-4.1-mini",
messages=[{"role": "user", "content": "Hello."}],
)