Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
16 changes: 16 additions & 0 deletions doc/source/locale/de/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -209,3 +209,19 @@ msgstr "Starten Sie das Rerank-Modell und berechnen Sie die Textähnlichkeit:"
#~ "Bei der Verwendung von Anthropic zum Senden von Anfragen bleibt die "
#~ "Kompatibilität mit der Anthropic-Schnittstelle erhalten, mit Ausnahme der "
#~ "Modellerstellung."

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "Tokenanzahl bei Cache-Treffern"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "Bei vLLM, SGLang und MLX geben Completion- und Chat-Completion-Antworten die von der Engine gemeldete Anzahl wiederverwendeter Prompt-Token in ``usage.prompt_tokens_details.cached_tokens`` zurück, sofern verfügbar. Diese Anzahl umfasst die von der Engine gemeldete Wiederverwendung aus dem nativen Präfix-Cache und dem Xavier-Cache. Sie ist Teil von ``prompt_tokens`` und keine zusätzliche Tokenanzahl."

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "Setzen Sie bei Streaming-Anfragen ``stream_options={\"include_usage\": True}``, um den abschließenden Nutzungs-Chunk mit ``choices=[]`` zu erhalten. Die Responses API gibt dieselbe Anzahl als ``usage.input_tokens_details.cached_tokens`` zurück. Wenn die Engine keine Cache-Treffer meldet, lassen Completion- und Chat-Completion-Antworten ``prompt_tokens_details`` weg; die Responses API verwendet standardmäßig null."

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "Bei der P/D-Trennung umfasst diese Anzahl auch vom Prefill-Motor übertragene KV, selbst wenn sie für die aktuelle Anfrage berechnet wurden; historische Präfix-Cache-Treffer im Prefill-Motor werden nicht separat gezählt."
16 changes: 16 additions & 0 deletions doc/source/locale/es/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -207,3 +207,19 @@ msgstr "Inicia el modelo rerank y calcula la similitud de texto:"
#~ "Anthropic client request with the same function as before, excluding launch "
#~ "model."
#~ msgstr ""

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "Número de tokens encontrados en caché"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "Con vLLM, SGLang y MLX, las respuestas de completado y completado de chat exponen el número de tokens del prompt reutilizados por el motor en ``usage.prompt_tokens_details.cached_tokens``, cuando está disponible. Este número incluye la reutilización de la caché de prefijos nativa y de la caché Xavier que informa el motor; forma parte de ``prompt_tokens`` y no es un número adicional de tokens."

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "Para las solicitudes en streaming, establezca ``stream_options={\"include_usage\": True}`` para recibir el bloque final de uso con ``choices=[]``. La Responses API expone el mismo número como ``usage.input_tokens_details.cached_tokens``. Si el motor no informa de aciertos de caché, las respuestas de completado y completado de chat omiten ``prompt_tokens_details``; la Responses API utiliza cero de forma predeterminada."

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "Con la separación P/D, este número incluye los KV transferidos desde el motor de prellenado, aunque se hayan calculado para la solicitud actual; no mide por separado los aciertos históricos de la caché de prefijos del motor de prellenado."
16 changes: 16 additions & 0 deletions doc/source/locale/fr/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -211,3 +211,19 @@ msgstr "Lancez le modèle rerank et calculez la similarité textuelle :"
#~ "Lors de l'envoi de requêtes avec Anthropic, toutes les requêtes, à "
#~ "l'exception de la création de modèles, restent compatibles avec l'interface "
#~ "d'Anthropic."

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "Nombre de tokens trouvés en cache"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "Avec vLLM, SGLang et MLX, les réponses de complétion et de complétion de chat exposent le nombre de tokens du prompt réutilisés par le moteur dans ``usage.prompt_tokens_details.cached_tokens``, lorsque cette information est disponible. Ce nombre inclut la réutilisation du cache de préfixes natif et du cache Xavier signalée par le moteur ; il fait partie de ``prompt_tokens`` et ne constitue pas un nombre de tokens supplémentaire."

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "Pour les requêtes en streaming, définissez ``stream_options={\"include_usage\": True}`` afin de recevoir le dernier bloc de statistiques avec ``choices=[]``. La Responses API expose le même nombre dans ``usage.input_tokens_details.cached_tokens``. Si le moteur ne signale pas les succès de cache, les réponses de complétion et de complétion de chat omettent ``prompt_tokens_details`` ; la Responses API utilise zéro par défaut."

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "Avec la séparation P/D, ce nombre inclut les KV transférés depuis le moteur de préremplissage, même si ces KV ont été calculés pour la requête en cours ; il ne mesure pas séparément les succès du cache de préfixes historique de ce moteur."
16 changes: 16 additions & 0 deletions doc/source/locale/it/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -210,3 +210,19 @@ msgstr "Caricare il modello di rerank e calcolare la similarità testuale:"
#~ "Quando si inviano richieste utilizzando Anthropic, ad eccezione della "
#~ "creazione del modello, tutte le altre richieste rimangono compatibili con "
#~ "l'interfaccia di Anthropic."

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "Numero di token trovati nella cache"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "Con vLLM, SGLang e MLX, le risposte di completamento e completamento chat espongono il numero di token del prompt riutilizzati dal motore in ``usage.prompt_tokens_details.cached_tokens``, quando disponibile. Questo numero include il riutilizzo della cache dei prefissi nativa e della cache Xavier riportato dal motore; fa parte di ``prompt_tokens`` e non rappresenta un numero aggiuntivo di token."

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "Per le richieste in streaming, impostare ``stream_options={\"include_usage\": True}`` per ricevere il blocco finale delle statistiche di utilizzo con ``choices=[]``. La Responses API espone lo stesso numero come ``usage.input_tokens_details.cached_tokens``. Se il motore non riporta gli accessi riusciti alla cache, le risposte di completamento e completamento chat omettono ``prompt_tokens_details``; la Responses API utilizza zero come valore predefinito."

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "Con la separazione P/D, questo numero include i KV trasferiti dal motore di prefill, anche se sono stati calcolati per la richiesta corrente; non misura separatamente gli accessi alla cache dei prefissi di richieste precedenti nel motore di prefill."
16 changes: 16 additions & 0 deletions doc/source/locale/ja/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -192,3 +192,19 @@ msgstr "rerankモデルを起動し、テキスト類似度を計算する:"
#~ msgstr ""
#~ "Anthropic を使用してリクエストを送信する場合、モデルの作成を除き、その他のリクエストはすべて Anthropic "
#~ "のインターフェースとの互換性を維持します。"

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "キャッシュヒットしたトークン数"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "vLLM、SGLang、MLX では、エンジンが統計を提供する場合、補完およびチャット補完のレスポンスの ``usage.prompt_tokens_details.cached_tokens`` に、再利用されたプロンプトトークン数が含まれます。この数値には、エンジンが報告したネイティブのプレフィックスキャッシュと Xavier キャッシュの再利用が含まれます。これは ``prompt_tokens`` の一部であり、追加のトークン数ではありません。"

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "ストリーミングリクエストでは、``stream_options={\"include_usage\": True}`` を設定すると、``choices=[]`` の最終使用量チャンクを受け取れます。Responses API は同じ数値を ``usage.input_tokens_details.cached_tokens`` で返します。エンジンがキャッシュヒットを報告しない場合、補完およびチャット補完のレスポンスでは ``prompt_tokens_details`` が省略され、Responses API では既定値のゼロが返されます。"

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "P/D 分離では、この数値にプリフィルエンジンから転送された KV が含まれます。その KV が現在のリクエストで計算された場合も含まれ、プリフィルエンジンでの過去のプレフィックスキャッシュのヒット数を個別に示すものではありません。"
16 changes: 16 additions & 0 deletions doc/source/locale/ko/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -193,3 +193,19 @@ msgstr "rerank 모델을 불러와 텍스트 유사도를 계산합니다:"
#~ "model."
#~ msgstr ""
#~ "Anthropic을 사용하여 요청을 보낼 때, 모델 생성 외의 모든 요청은 Anthropic의 인터페이스와 호환성을 유지합니다."

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "캐시 적중 토큰 수"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "vLLM, SGLang, MLX에서 엔진이 통계를 제공하면 완성 및 채팅 완성 응답의 ``usage.prompt_tokens_details.cached_tokens``에 재사용된 프롬프트 토큰 수가 포함됩니다. 이 값에는 엔진이 보고한 기본 접두사 캐시 재사용과 Xavier 캐시 재사용이 포함됩니다. ``prompt_tokens``의 일부이며 추가 토큰 수가 아닙니다."

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "스트리밍 요청에서 ``stream_options={\"include_usage\": True}``를 설정하면 ``choices=[]``인 최종 사용량 청크를 받을 수 있습니다. Responses API는 동일한 값을 ``usage.input_tokens_details.cached_tokens``로 반환합니다. 엔진이 캐시 적중을 보고하지 않으면 완성 및 채팅 완성 응답에서 ``prompt_tokens_details``가 생략되고 Responses API는 기본값인 0을 반환합니다."

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "P/D 분리에서는 현재 요청을 위해 계산된 KV도 포함하여 프리필 엔진에서 전송된 KV를 이 값에 포함합니다. 프리필 엔진의 이전 접두사 캐시 적중 횟수를 별도로 나타내지는 않습니다."
16 changes: 16 additions & 0 deletions doc/source/locale/pt_BR/LC_MESSAGES/user_guide/client_api.po
Original file line number Diff line number Diff line change
Expand Up @@ -207,3 +207,19 @@ msgstr "Iniciar o modelo de rerank e calcular a similaridade textual:"
#~ msgstr ""
#~ "Ao enviar requisições usando Anthropic, exceto para criar modelos, todas as "
#~ "outras requisições mantêm compatibilidade com a interface do Anthropic."

#: user_guide/client_api.rst:96
msgid "Cache hit token counts"
msgstr "Quantidade de tokens encontrados no cache"

#: user_guide/client_api.rst:99
msgid "With vLLM, SGLang, and MLX, completion and chat completion responses expose the engine's reused prompt-token count in ``usage.prompt_tokens_details.cached_tokens`` when available. This count includes native prefix-cache reuse and Xavier cache reuse reported by the engine; it is part of ``prompt_tokens``, not an additional token count."
msgstr "Com vLLM, SGLang e MLX, as respostas de completamento e completamento de chat expõem a quantidade de tokens do prompt reutilizados pelo mecanismo em ``usage.prompt_tokens_details.cached_tokens``, quando disponível. Essa quantidade inclui a reutilização do cache de prefixos nativo e do cache Xavier informada pelo mecanismo; faz parte de ``prompt_tokens`` e não é uma quantidade adicional de tokens."

#: user_guide/client_api.rst:103
msgid "For streaming requests, set ``stream_options={\"include_usage\": True}`` to receive the final usage chunk with ``choices=[]``. The Responses API exposes the same count as ``usage.input_tokens_details.cached_tokens``. If the engine does not report cache hits, completion and chat completion responses omit ``prompt_tokens_details``; the Responses API defaults the count to zero."
msgstr "Para solicitações em streaming, defina ``stream_options={\"include_usage\": True}`` para receber o bloco final de uso com ``choices=[]``. A Responses API expõe a mesma quantidade como ``usage.input_tokens_details.cached_tokens``. Se o mecanismo não informar acertos de cache, as respostas de completamento e completamento de chat omitem ``prompt_tokens_details``; a Responses API usa zero por padrão."

#: user_guide/client_api.rst:101
msgid "With P/D disaggregation, this count includes KV transferred from the prefill engine, even when that KV was computed for the current request; it does not separately measure historical prefix-cache hits on the prefill engine."
msgstr "Com a separação P/D, essa quantidade inclui os KV transferidos do mecanismo de prefill, mesmo quando foram calculados para a solicitação atual; ela não mede separadamente os acertos históricos do cache de prefixos do mecanismo de prefill."
Loading
Loading