Claude Platform на AWS: Ограничения скорости, описанные на этой странице, применяются к Claude Platform на AWS, но выставление счетов и управление лимитами отличаются. Выставление счетов осуществляется через AWS Marketplace (а не через покупку кредитов Anthropic). Организации на Claude Platform на AWS помещаются на уровень Start и не перемещаются между уровнями использования автоматически. Чтобы запросить более высокие лимиты, свяжитесь с вашим представителем по работе с клиентами Anthropic или со службой поддержки Anthropic; процесс Request rate limit increase недоступен. Лимиты расходов устанавливаются в Settings > Billing, а не в Settings > Limits. Настройка ограничений скорости для отдельных рабочих пространств и быстрый режим недоступны на Claude Platform на AWS. Подробности см. в разделе Ограничения скорости и квоты на Claude Platform на AWS.
Существует два типа ограничений:
API применяет настроенные сервисом ограничения на уровне организации, но вы также можете установить настраиваемые пользователем ограничения для рабочих пространств вашей организации.
Claude Platform на AWS: Лимиты расходов работают иначе на Claude Platform на AWS. Устанавливайте лимиты расходов в Settings > Billing вместо Settings > Limits. См. раздел Лимиты расходов на Claude Platform на AWS, чтобы узнать, как предельные значения расходов и самостоятельно установленные лимиты расходов применяются к вашей организации.
Каждый из уровней Start, Build и Scale имеет ежемесячный предел расходов, который является максимумом, который ваша организация может потратить на API за каждый календарный месяц. Как только вы достигнете предела расходов вашего уровня, использование API приостанавливается до следующего месяца, если вы не запросите более высокий лимит. Вы можете просмотреть ежемесячный предел расходов вашей организации на странице Limits.
| Уровень использования | Ежемесячный предел расходов |
|---|---|
| Start | $500 USD |
| Build | $1,000 USD |
| Scale | $200,000 USD |
Организации на уровне Custom не имеют ежемесячного предела расходов; лимиты согласовываются с их командой по работе с клиентами.
Вы также можете установить собственный лимит расходов ниже предела вашего уровня для контроля затрат:
Перейдите на страницу Limits
Перейдите в Settings > Limits в Claude Console.
Откройте редактор лимита расходов
В разделе Spend limits нажмите Change Limit (или Set spend limit, если лимит ещё не установлен).
Настройте ваш лимит расходов
Введите новое значение. Ваш лимит расходов не может превышать предел вашего текущего уровня.
Ограничения скорости для Messages API измеряются в запросах в минуту (RPM), входных токенах в минуту (ITPM) и выходных токенах в минуту (OTPM) для каждого класса моделей.
Если вы превысите любое из ограничений скорости, вы получите ошибку 429, описывающую, какое ограничение скорости было превышено, вместе с заголовком retry-after, указывающим, сколько нужно подождать.
Вы также можете столкнуться с ошибками 429 из-за ограничений ускорения (acceleration limits) в API, если в вашей организации происходит резкое увеличение использования. Чтобы избежать достижения ограничений ускорения, наращивайте трафик постепенно и поддерживайте стабильные шаблоны использования.
Многие поставщики API используют комбинированный лимит «токенов в минуту» (TPM), который может включать все токены, как кэшированные, так и некэшированные, входные и выходные. Для большинства моделей Claude только некэшированные входные токены учитываются в ваших ограничениях скорости ITPM. Это ключевое преимущество, которое делает ограничения скорости фактически выше, чем они могут показаться на первый взгляд.
Ограничения скорости ITPM оцениваются в начале каждого запроса, и оценка корректируется во время запроса, чтобы отразить фактическое количество использованных входных токенов.
Вот что учитывается в ITPM:
input_tokens (токены после последней точки останова кэша) ✓ Учитываются в ITPMcache_creation_input_tokens (токены, записываемые в кэш) ✓ Учитываются в ITPMcache_read_input_tokens (токены, читаемые из кэша) ✗ НЕ учитываются в ITPM для большинства моделейПоле input_tokens представляет только токены, которые появляются после вашей последней точки останова кэша, а не все входные токены в вашем запросе. Чтобы вычислить общее количество входных токенов:
total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokensЭто означает, что при наличии кэшированного содержимого input_tokens обычно будет значительно меньше вашего общего ввода. Например, с кэшированным документом на 200 тыс. токенов и вопросом пользователя на 50 токенов вы увидите input_tokens: 50, хотя общий ввод составляет 200 050 токенов.
Для целей ограничения скорости на большинстве моделей только input_tokens + cache_creation_input_tokens учитываются в вашем лимите ITPM, что делает кэширование подсказок эффективным способом увеличения вашей фактической пропускной способности.
Пример: С лимитом ITPM в 2 000 000 и коэффициентом попадания в кэш 80% вы могли бы фактически обрабатывать 10 000 000 общих входных токенов в минуту (2 млн некэшированных + 8 млн кэшированных), потому что кэшированные токены не учитываются в вашем ограничении скорости.
Claude Haiku 3.5 (отмеченная символом † в следующих таблицах ограничений скорости) также учитывает cache_read_input_tokens в ограничениях скорости ITPM.
Для всех моделей без маркера † кэшированные входные токены не учитываются в ограничениях скорости и тарифицируются по сниженной ставке (10% от базовой цены входного токена). Это означает, что вы можете достичь значительно более высокой фактической пропускной способности, используя кэширование подсказок.
Максимизируйте ваши ограничения скорости с помощью кэширования подсказок
См. кэширование подсказок для руководства по увеличению фактической пропускной способности путём кэширования повторяющегося содержимого, такого как:
При эффективном кэшировании вы можете значительно увеличить вашу фактическую пропускную способность без увеличения ваших ограничений скорости. Отслеживайте коэффициент попадания в кэш на странице Usage, чтобы оптимизировать вашу стратегию кэширования.
Ограничения скорости OTPM оцениваются в реальном времени по мере генерации выходных токенов, учитывая только фактически сгенерированные токены. Параметр max_tokens не учитывается при расчёте ограничений скорости OTPM, поэтому установка более высокого значения max_tokens не имеет недостатков с точки зрения ограничений скорости.
Ограничения скорости применяются отдельно для каждой модели; следовательно, вы можете использовать разные модели одновременно до их соответствующих лимитов. Вы можете проверить ваши текущие ограничения скорости и их поведение на странице Limits в Claude Console или прочитать настроенные лимиты программно с помощью Rate Limits API.
Ограничения скорости в настоящее время являются общими для всех значений inference_geo. Запросы с inference_geo: "us" и inference_geo: "global" используют один и тот же пул ограничений скорости.
| Модель | Максимум запросов в минуту (RPM) | Максимум входных токенов в минуту (ITPM) | Максимум выходных токенов в минуту (OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1,000 | 500,000 | 100,000 |
| Claude Opus 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Opus 4.x* | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 4.x** | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 4.5 | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 3.5 (выведена из эксплуатации, кроме Bedrock и Google Cloud) | 1,000 | 100,000† | 20,000 |
* Ограничение скорости Opus является общим лимитом, который применяется к совокупному трафику Claude Opus 4.8, Opus 4.7, Opus 4.6 и Opus 4.5. Claude Opus 5 имеет отдельное ограничение скорости и не входит в этот общий пул.
** Ограничение скорости Sonnet 4.x является общим лимитом, который применяется к совокупному трафику Sonnet 4.6 и Sonnet 4.5. Claude Sonnet 5 имеет отдельное ограничение скорости и не входит в этот общий пул.
† Лимит учитывает cache_read_input_tokens в использовании ITPM.
Message Batches API имеет собственный набор ограничений скорости, которые являются общими для всех моделей. Они включают лимит запросов в минуту (RPM) для всех конечных точек API и лимит на количество пакетных запросов, которые могут одновременно находиться в очереди обработки. «Пакетный запрос» здесь относится к части Message Batch. Вы можете создать Message Batch, содержащий тысячи пакетных запросов, каждый из которых учитывается в этом лимите. Пакетный запрос считается частью очереди обработки, когда он ещё не был успешно обработан моделью.
| Максимум запросов в минуту (RPM) | Максимум пакетных запросов в очереди обработки | Максимум пакетных запросов на пакет |
|---|---|---|
| 1,000 | 200,000 | 100,000 |
Конечные точки Claude Managed Agents имеют ограничения скорости на уровне организации. Эти лимиты отделены от ограничений скорости Messages API, указанных выше.
| Операция | Лимит |
|---|---|
| Конечные точки создания (например, агенты, сессии и окружения) | 300 запросов в минуту |
| Конечные точки чтения (например, получение, список и потоковая передача) | 1,200 запросов в минуту |
При использовании быстрого режима (исследовательская предварительная версия) с speed: "fast" на Claude Opus 5, Opus 4.8 или Opus 4.7 применяются выделенные ограничения скорости, отдельные от стандартных ограничений скорости Opus. Когда ограничения скорости быстрого режима превышены, API возвращает ошибку 429 с заголовком retry-after. Быстрый режим недоступен на Claude Opus 4.6: запросы к claude-opus-4-6 с speed: "fast" выполняются со стандартной скоростью. См. Быстрый режим.
Ответ включает заголовки anthropic-fast-*, которые указывают статус вашего ограничения скорости быстрого режима. См. Ограничения скорости быстрого режима для подробностей об этих заголовках.
Вы можете отслеживать использование ваших ограничений скорости на странице Usage в Claude Console.
Помимо графиков токенов и запросов, страница Usage предоставляет два отдельных графика ограничений скорости. Используйте эти графики, чтобы увидеть, какой запас у вас есть для роста, определить, когда вы можете достигать пикового использования, понять, какие ограничения скорости запрашивать, и узнать, как улучшить ваши показатели кэширования. Графики визуализируют ряд метрик для заданного ограничения скорости (например, по модели):
Чтобы запросить более высокие ограничения скорости или более высокий ежемесячный предел расходов, используйте Request rate limit increase на странице Limits.
Служба поддержки также может повысить лимиты. Для срочных потребностей обратитесь в службу поддержки Anthropic.
Claude Platform на AWS: Процесс Request rate limit increase недоступен. Свяжитесь с вашим представителем по работе с клиентами Anthropic или со службой поддержки Anthropic и укажите модели, для которых нужно повысить лимиты, ваши пиковые значения входных и выходных токенов в минуту для каждой модели и примерную долю вашего ввода, которая является кэшированным или повторяющимся контекстом. См. Ограничения скорости и квоты на Claude Platform на AWS.
Подробнее о рабочих пространствах см. в разделе Рабочие пространства.
Чтобы защитить рабочие пространства в вашей организации от потенциального чрезмерного использования, вы можете установить пользовательские лимиты расходов и ограничения скорости для каждого рабочего пространства.
Пример: Если лимит вашей организации составляет 40 000 входных токенов в минуту и 8 000 выходных токенов в минуту, вы можете ограничить одно рабочее пространство до 30 000 входных токенов в минуту. Это защищает другие рабочие пространства от потенциального чрезмерного использования и обеспечивает более справедливое распределение ресурсов в вашей организации. Оставшиеся неиспользованные токены в минуту (или больше, если это рабочее пространство не использует лимит) затем доступны для использования другими рабочими пространствами.
Примечание:
Чтобы программно прочитать ваши текущие ограничения скорости организации и рабочих пространств, используйте Rate Limits API.
Ответ API включает заголовки, которые показывают применяемое ограничение скорости, текущее использование и время сброса лимита.
Возвращаются следующие заголовки:
| Заголовок | Описание |
|---|---|
retry-after | Количество секунд ожидания до повторной попытки запроса. Более ранние повторные попытки завершатся неудачей. |
anthropic-ratelimit-requests-limit | Максимальное количество запросов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-requests-remaining | Количество оставшихся запросов до применения ограничения скорости. |
anthropic-ratelimit-requests-reset | Время, когда ограничение скорости запросов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-tokens-limit | Максимальное количество токенов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-tokens-remaining | Количество оставшихся токенов (округлённое до ближайшей тысячи) до применения ограничения скорости. |
anthropic-ratelimit-tokens-reset | Время, когда ограничение скорости токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-input-tokens-limit | Максимальное количество входных токенов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-input-tokens-remaining | Количество оставшихся входных токенов (округлённое до ближайшей тысячи) до применения ограничения скорости. |
anthropic-ratelimit-input-tokens-reset | Время, когда ограничение скорости входных токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-output-tokens-limit | Максимальное количество выходных токенов, разрешённых в течение любого периода ограничения скорости. |
anthropic-ratelimit-output-tokens-remaining | Количество оставшихся выходных токенов (округлённое до ближайшей тысячи) до применения ограничения скорости. |
anthropic-ratelimit-output-tokens-reset | Время, когда ограничение скорости выходных токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-priority-input-tokens-limit | Максимальное количество входных токенов Priority Tier, разрешённых в течение любого периода ограничения скорости. (Только Priority Tier) |
anthropic-priority-input-tokens-remaining | Количество оставшихся входных токенов Priority Tier (округлённое до ближайшей тысячи) до применения ограничения скорости. (Только Priority Tier) |
anthropic-priority-input-tokens-reset | Время, когда ограничение скорости входных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier) |
anthropic-priority-output-tokens-limit | Максимальное количество выходных токенов Priority Tier, разрешённых в течение любого периода ограничения скорости. (Только Priority Tier) |
anthropic-priority-output-tokens-remaining | Количество оставшихся выходных токенов Priority Tier (округлённое до ближайшей тысячи) до применения ограничения скорости. (Только Priority Tier) |
anthropic-priority-output-tokens-reset | Время, когда ограничение скорости выходных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier) |
Заголовки anthropic-ratelimit-tokens-* отображают значения для наиболее строгого лимита, действующего в данный момент. Например, если вы превысили поминутный лимит токенов рабочего пространства, заголовки будут содержать значения поминутного ограничения скорости токенов рабочего пространства. Если лимиты рабочего пространства не применяются, заголовки вернут общее количество оставшихся токенов, где общее количество — это сумма входных и выходных токенов. Такой подход обеспечивает вам видимость наиболее значимого ограничения для вашего текущего использования API.
Was this page helpful?