FINAL-Bench представила Darwin-180B-RSI, мультимодальную модель на 180 млрд параметров, работающую с изображениями и текстом. В карточке модели есть команды для запуска через Transformers, vLLM, SGLang и Docker Model Runner.

Разработчики заявляют, что модель обучается на собственных решениях, проверенных по ключам ответов. Заявленные результаты сравниваются только среди моделей с открытыми весами, а значения публикуют сами поставщики моделей.

Проверка утверждений:

  • FINAL-Bench представила Darwin-180B-RSI, мультимодальную модель на 180 млрд параметров, работающую с изображениями и текстом. (подтверждено самой публикацией: доказательство; «### 180B Mixture-of-Experts · vision-language · #1 on six Hugging Face official leaderboards — AIME 2026 100 · HMMT Feb 2026 100 · GPQA Diamond 94.44 · MMLU-Pro 88.12 · MMMU-Pro 79.48 · LEXam 68.94 · self-improving»)
  • В карточке модели есть команды для запуска через Transformers, vLLM, SGLang и Docker Model Runner. (подтверждено самой публикацией: доказательство; «### Instructions to use FINAL-Bench/Darwin-180B-RSI with libraries, inference providers, notebooks, and local apps. Follow these links to get started.»)
  • Разработчики заявляют, что модель обучается на собственных решениях, проверенных по ключам ответов. (подтверждено самой публикацией: доказательство; «the parent’s own solutions, checked against verifiable answer keys, fed back as training signal»)
  • Заявленные результаты сравниваются только среди моделей с открытыми весами, а значения публикуют сами поставщики моделей. (подтверждено самой публикацией: доказательство; «This comparison covers open-weight models listed on the Hugging Face official benchmark leaderboards; closed API models are not included. Leaderboard values are each publisher’s own reported numbers; settings (samples, voting, thinking budget) differ across models.»)

Первоисточники:

оценка 49,3 из 100 · тип: анонс