Авторът представи unalloc, инструмент с отворен код за сверяване на разходи, който обединява данни от OpenCost, LiteLLM, OpenAI и Anthropic в една точна ведомост и показва дела на разходите без собственик.

В конструиран сценарий за внедряване с много подове за един месец синтетични разпределения от OpenCost етикети за собственик само на водещите подове на LeaderWorkerSet оставиха без собственик 66% от сметката за GPU. Естествен резервен ключ отнесе 61% от сметката към име на Helm chart и намали отчетения дял на неразпределените разходи до 4%.

На NVIDIA H100 с vLLM, сървър за инференс, брояч по токени, който разпределя разходите според броя токени, отнесе към клиент с преобладаващи операции по търсене с 12–14 процентни пункта по-голям дял от сметката, отколкото брояч с равно разпределение по време, при всяко проверено натоварване. Авторът отбелязва, че нито един от двата брояча не дава еталонно разпределение.

Проверка на твърденията:

  • Авторът представи unalloc, инструмент с отворен код, който обединява данни за разходи от OpenCost, LiteLLM, OpenAI и Anthropic в една точна ведомост и показва дела на разходите без собственик. (потвърдено от самата публикация: доказателство; «We present unalloc, an open-source tool that joins OpenCost, LiteLLM, OpenAI and Anthropic cost data into one exact ledger and reports the share of spend with no owner»)
  • В конструиран сценарий за внедряване с много подове за един месец синтетични разпределения от OpenCost етикети за собственик само на водещите подове на LeaderWorkerSet оставиха без собственик 66% от сметката за GPU. (потвърдено от самата публикация: доказателство; «in a constructed multi-pod deployment scenario – one month of synthetic OpenCost allocations, not observed billing data – owner labels set only on LeaderWorkerSet leader pods leave 66% of that deployment’s GPU bill unowned»)
  • Естествен резервен ключ отнесе 61% от сметката към име на Helm chart и намали отчетения дял на неразпределените разходи до 4%. (потвърдено от самата публикация: доказателство; «the natural fallback key assigns 61% of it to a Helm chart name while the headline unallocated share falls to 4%»)
  • На NVIDIA H100 с vLLM брояч по токени отнесе към клиент с преобладаващи операции по търсене с 12–14 процентни пункта по-голям дял от сметката, отколкото брояч с равно разпределение по време, при всяко проверено натоварване. (потвърдено от самата публикация: доказателство; «on an NVIDIA H100 running vLLM, a token meter assigns a retrieval-heavy tenant 12-14 percentage points more of the bill than an equal time-share meter at every load tested»)
  • Авторът отбелязва, че нито един от двата брояча не дава еталонно разпределение. (потвърдено от самата публикация: доказателство; «Neither meter is a ground truth»)

Първоизточници:

оценка 64,4 от 100 · вид: изследване