Автор представил unalloc, инструмент с открытым кодом для сверки затрат, который объединяет данные OpenCost, LiteLLM, OpenAI и Anthropic в одну точную ведомость и показывает долю расходов без владельца.
В сконструированном сценарии многоподового развёртывания за один месяц синтетических распределений OpenCost метки владельца только на ведущих подах LeaderWorkerSet оставили без владельца 66% счёта за GPU. Естественный резервный ключ отнёс 61% счёта к имени Helm chart и снизил заявленную долю нераспределённых расходов до 4%.
На NVIDIA H100 с vLLM, сервером инференса, счётчик по токенам, который распределяет затраты по числу токенов, отнёс на клиента с преобладанием операций поиска на 12–14 процентных пунктов большую долю счёта, чем счётчик с равным делением по времени, при каждой проверенной нагрузке. Авторы отмечают, что ни один из двух счётчиков не даёт эталонного распределения.
Проверка утверждений:
- Автор представил unalloc, инструмент с открытым кодом, который объединяет данные о затратах OpenCost, LiteLLM, OpenAI и Anthropic в одну точную ведомость и показывает долю расходов без владельца. (подтверждено самой публикацией: доказательство; «We present unalloc, an open-source tool that joins OpenCost, LiteLLM, OpenAI and Anthropic cost data into one exact ledger and reports the share of spend with no owner»)
- В сконструированном сценарии многоподового развёртывания за один месяц синтетических распределений OpenCost метки владельца только на ведущих подах LeaderWorkerSet оставили без владельца 66% счёта за GPU. (подтверждено самой публикацией: доказательство; «in a constructed multi-pod deployment scenario – one month of synthetic OpenCost allocations, not observed billing data – owner labels set only on LeaderWorkerSet leader pods leave 66% of that deployment’s GPU bill unowned»)
- Естественный резервный ключ отнёс 61% счёта к имени Helm chart и снизил заявленную долю нераспределённых расходов до 4%. (подтверждено самой публикацией: доказательство; «the natural fallback key assigns 61% of it to a Helm chart name while the headline unallocated share falls to 4%»)
- На NVIDIA H100 с vLLM счётчик по токенам отнёс на клиента с преобладанием операций поиска на 12–14 процентных пунктов большую долю счёта, чем счётчик с равным делением по времени, при каждой проверенной нагрузке. (подтверждено самой публикацией: доказательство; «on an NVIDIA H100 running vLLM, a token meter assigns a retrieval-heavy tenant 12-14 percentage points more of the bill than an equal time-share meter at every load tested»)
- Авторы отмечают, что ни один из двух счётчиков не даёт эталонного распределения. (подтверждено самой публикацией: доказательство; «Neither meter is a ground truth»)
Первоисточники:
оценка 64,4 из 100 · тип: исследование