Автор представив unalloc, інструмент з відкритим кодом для звірки витрат, який об’єднує дані OpenCost, LiteLLM, OpenAI та Anthropic в одну точну відомість і показує частку витрат без власника.

У сконструйованому сценарії багатоподового розгортання за один місяць синтетичних розподілів OpenCost мітки власника лише на провідних подах LeaderWorkerSet залишили без власника 66% рахунку за GPU. Природний резервний ключ відніс 61% рахунку до назви Helm chart і зменшив заявлену частку нерозподілених витрат до 4%.

На NVIDIA H100 з vLLM, сервером інференсу, лічильник за токенами, який розподіляє витрати за кількістю токенів, відніс на клієнта з переважанням операцій пошуку на 12–14 відсоткових пунктів більшу частку рахунку, ніж лічильник з рівним поділом за часом, для кожного перевіреного навантаження. Автор зазначає, що жоден із двох лічильників не дає еталонного розподілу.

Перевірка тверджень:

  • Автор представив unalloc, інструмент з відкритим кодом, який об’єднує дані про витрати OpenCost, LiteLLM, OpenAI та Anthropic в одну точну відомість і показує частку витрат без власника. (підтверджено самою публікацією: доказ; «We present unalloc, an open-source tool that joins OpenCost, LiteLLM, OpenAI and Anthropic cost data into one exact ledger and reports the share of spend with no owner»)
  • У сконструйованому сценарії багатоподового розгортання за один місяць синтетичних розподілів OpenCost мітки власника лише на провідних подах LeaderWorkerSet залишили без власника 66% рахунку за GPU. (підтверджено самою публікацією: доказ; «in a constructed multi-pod deployment scenario – one month of synthetic OpenCost allocations, not observed billing data – owner labels set only on LeaderWorkerSet leader pods leave 66% of that deployment’s GPU bill unowned»)
  • Природний резервний ключ відніс 61% рахунку до назви Helm chart і зменшив заявлену частку нерозподілених витрат до 4%. (підтверджено самою публікацією: доказ; «the natural fallback key assigns 61% of it to a Helm chart name while the headline unallocated share falls to 4%»)
  • На NVIDIA H100 з vLLM лічильник за токенами відніс на клієнта з переважанням операцій пошуку на 12–14 відсоткових пунктів більшу частку рахунку, ніж лічильник з рівним поділом за часом, для кожного перевіреного навантаження. (підтверджено самою публікацією: доказ; «on an NVIDIA H100 running vLLM, a token meter assigns a retrieval-heavy tenant 12-14 percentage points more of the bill than an equal time-share meter at every load tested»)
  • Автор зазначає, що жоден із двох лічильників не дає еталонного розподілу. (підтверджено самою публікацією: доказ; «Neither meter is a ground truth»)

Першоджерела:

оцінка 64,4 зі 100 · тип: дослідження