> ## Documentation Index
> Fetch the complete documentation index at: https://apidoc.cometapi.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Rate Limits und Parallelität handhaben

> Behandeln Sie CometAPI-Rate-Limits, indem Sie die Anfragen-Parallelität begrenzen, `429`-Antworten mit Jitter erneut versuchen und die Nutzung nach model und Route überwachen.

Behandeln Sie Rate Limits, indem Sie die Parallelität kontrollieren, bevor Anfragen Ihre App verlassen. Wenn CometAPI `429` zurückgibt, versuchen Sie es mit exponentiellem Backoff und Jitter erneut und reduzieren Sie dann Burst-Traffic, falls wiederholte Retries auftreten.

## Parallelität begrenzen

Das folgende Python-Beispiel begrenzt gleichzeitige Chat-Anfragen mit einem asynchronen Semaphore:

```python theme={null}
import asyncio
import os
from openai import AsyncOpenAI

client = AsyncOpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

semaphore = asyncio.Semaphore(5)

async def ask(prompt):
    async with semaphore:
        completion = await client.chat.completions.create(
            model="your-model-id",
            messages=[{"role": "user", "content": prompt}],
        )
        return completion.choices[0].message.content

async def main():
    prompts = ["Say hello.", "Write a title.", "Return one JSON key."]
    results = await asyncio.gather(*(ask(prompt) for prompt in prompts))
    print(results)

asyncio.run(main())
```

Das Ergebnis ist ein Array von Modellausgaben:

```json theme={null}
[
  "Hello.",
  "A concise title",
  "{\"key\":\"value\"}"
]
```

## Rate Limits erneut versuchen

Das folgende JavaScript-Beispiel versucht `429`-Antworten mit Jitter erneut:

```javascript theme={null}
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.COMETAPI_KEY,
  baseURL: "https://api.cometapi.com/v1",
});

async function sleep(milliseconds) {
  return new Promise((resolve) => setTimeout(resolve, milliseconds));
}

async function createCompletion() {
  for (let attempt = 0; attempt < 5; attempt += 1) {
    try {
      return await client.chat.completions.create({
        model: "your-model-id",
        messages: [{ role: "user", content: "Say hello." }],
      });
    } catch (error) {
      if (error.status !== 429 || attempt === 4) {
        throw error;
      }

      const delay = Math.min(30000, 1000 * 2 ** attempt);
      await sleep(delay + Math.random() * 1000);
    }
  }
}

const completion = await createCompletion();
console.log(completion.choices[0].message.content);
```

Die erfolgreiche Antwort enthält eine normale Chat Completion:

```json theme={null}
{
  "choices": [
    {
      "message": {
        "content": "Hello."
      }
    }
  ]
}
```

## Häufige Fehler

| Error                          | Fix                                                                       |
| ------------------------------ | ------------------------------------------------------------------------- |
| Unbegrenzte parallele Anfragen | Fügen Sie ein Semaphore, eine Warteschlange oder einen Worker-Pool hinzu. |
| Alle Fehler erneut versuchen   | Versuchen Sie nur `429` und temporäre Serverfehler erneut.                |
| Keine Metriken pro Modell      | Protokollieren Sie Route, model ID, Status und Latenz für jede Anfrage.   |
| Retry-Sturm                    | Fügen Sie Jitter hinzu und begrenzen Sie die maximale Retry-Verzögerung.  |

## Verwandte Links

* [Fehlercodes und Wiederholungsstrategie](/de/guides/error-codes-and-retry-strategy)
* [Fehlercodes & Behandlung](/de/errors/error-codes-handling)
* [Modelle-Seite](/de/overview/models)
* [Modellverzeichnis](https://www.cometapi.com/models/)
* [Preise](https://www.cometapi.com/pricing/)
* [CometAPI-Schnellstart](/de/overview/quick-start)

<script type="application/ld+json">
  {`
    {
    "@context": "https://schema.org",
    "@graph": [
      {
        "@type": "TechArticle",
        "@id": "https://apidoc.cometapi.com/guides/rate-limits-and-concurrency",
        "headline": "Wie gehe ich mit Ratenlimits und Parallelität um?",
        "description": "Behandeln Sie CometAPI-Ratenlimits, indem Sie die Parallelität begrenzen, 429-Antworten mit Jitter wiederholen und die Nutzung nach model und Route überwachen.",
        "url": "https://apidoc.cometapi.com/guides/rate-limits-and-concurrency",
        "author": {
          "@type": "Organization",
          "name": "CometAPI"
        },
        "publisher": {
          "@type": "Organization",
          "name": "CometAPI",
          "url": "https://www.cometapi.com"
        }
      },
      {
        "@type": "BreadcrumbList",
        "itemListElement": [
          {
            "@type": "ListItem",
            "position": 1,
            "name": "CometAPI-Dokumentation",
            "item": "https://apidoc.cometapi.com/"
          },
          {
            "@type": "ListItem",
            "position": 2,
            "name": "Leitfäden",
            "item": "https://apidoc.cometapi.com/guides/use-cometapi-with-openai-sdk"
          },
          {
            "@type": "ListItem",
            "position": 3,
            "name": "Wie gehe ich mit Ratenlimits und Parallelität um?",
            "item": "https://apidoc.cometapi.com/guides/rate-limits-and-concurrency"
          }
        ]
      }
    ]
    }
    `}
</script>
