DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp — первую экспериментальную мультимодальную модель семейства DeepSeek-V4. Она предназначена для визуального понимания.
Модель построена на архитектуре DeepSeek-V4-Flash с добавлением визуальных модулей и дополнительным обучением. По заявлению DeepSeek, она существенно улучшила мультимодальные агентные возможности и сохранила сопоставимое качество в текстовых агентных задачах.
В опубликованной таблице текстовых агентных тестов модель получила 83,9 на Terminal Bench 2.1 и 59,3 на DeepSWE. В мультимодальных агентных тестах её результат составил 36,5 на ApexBench Pass@1 и 64,3 на Chartography.
Репозиторий содержит токенизатор, эталон кодирования промптов и минимальную реализацию инференса на PyTorch. На момент публикации модель не была развёрнута ни у одного Inference Provider на Hugging Face.
Проверка утверждений:
- DeepSeek представила в формате релиза DeepSeek-V4-Flash-Vision-Exp — первую экспериментальную мультимодальную модель семейства DeepSeek-V4, предназначенную для визуального понимания. (подтверждено первоисточником: доказательство; «We are excited to introduce DeepSeek-V4-Flash-Vision-Exp , our first experimental multimodal model in the DeepSeek-V4 family. It builds on the DeepSeek-V4-Flash architecture by incorporating visual modules and undergoing continued training to unlock visual understanding capabilities.»)
- Модель построена на архитектуре DeepSeek-V4-Flash с добавлением визуальных модулей и дополнительным обучением. (подтверждено первоисточником: доказательство; «It builds on the DeepSeek-V4-Flash architecture by incorporating visual modules and undergoing continued training to unlock visual understanding capabilities.»)
- По заявлению DeepSeek, по сравнению с DeepSeek-V4-Flash-0731 новая модель существенно улучшила мультимодальные агентные возможности, сохранив сопоставимое качество в текстовых агентных задачах. (подтверждено первоисточником: доказательство; «Compared to DeepSeek-V4-Flash-0731, DeepSeek-V4-Flash-Vision-Exp achieves substantial improvements on its multimodal agent capabilities, while maintaining comparable performance on text-only agent tasks.»)
- В опубликованной таблице текстовых агентных тестов DeepSeek-V4-Flash-Vision-Exp получила 83,9 на Terminal Bench 2.1 и 59,3 на DeepSWE; у DeepSeek-V4-Flash-0731 указаны 82,7 и 54,4 соответственно. (подтверждено первоисточником: доказательство; «Text Agent Capabilities Terminal Bench 2.1 83.9 82.7 85.0 NL2Repo 57.7 54.2 69.7 Cybergym 75.3 76.7 78.3 DeepSWE 59.3 54.4 58.0»)
- В мультимодальных агентных тестах для модели приведены результаты 36,5 на ApexBench Pass@1, 27,3 на Agents’ Last Exam, 64,3 на Chartography и 35,0 на ZeroBench Pass@5. (подтверждено первоисточником: доказательство; «Multimodal Agent Capabilities ApexBench (Pass@1) 36.5 26.2† 39.4 Agents’ Last Exam 27.3 25.2† 25.7 Chartography 64.3 - 65.0 ZeroBench (Pass@5) 35.0 - 34.0»)
- Текстовые агентные тесты моделей DeepSeek проводились в minimal mode фреймворка DeepSeek Harness при максимальном уровне reasoning effort, temperature 1,0 и top_p 0,95. (подтверждено первоисточником: доказательство; «For the text agent benchmarks above, DeepSeek models are evaluated with the minimal mode of DeepSeek Harness as the agent framework, using the max reasoning effort level with temperature = 1.0, top_p = 0.95 .»)
- Результаты DeepSeek-V4-Flash-0731 на ApexBench и Agents’ Last Exam ограничены тем, что эта модель игнорирует мультимодальные элементы входных данных. (подтверждено первоисточником: доказательство; «† For ApexBench and Agents’ Last Exam, DeepSeek-V4-Flash-0731 ignores the multimodal elements in the input.»)
- Репозиторий даёт разработчикам токенизатор, эталон кодирования промптов и минимальную реализацию инференса на PyTorch, охватывающую vision encoder и aligner, DFlash attention, MoE, Hyper-Connections и DSpark forward path. (подтверждено первоисточником: доказательство; «This repository contains the tokenizer, prompt encoding reference, and a minimal PyTorch inference implementation for DeepSeek-V4 Flash Vision. The reference inference covers the vision encoder and aligner, DFlash attention, MoE, Hyper-Connections, and the DSpark forward path.»)
- Кодирование поддерживает OpenAI-style JSON content blocks и компактную TXT-запись
path ; два примера дают одинаковые промпты и идентификаторы токенов. (подтверждено первоисточником: доказательство; «Both OpenAI-style JSON content blocks and the compactpath TXT notation are supported. The two examples under inference/examples/ encode to identical prompts and token IDs.») - На момент публикации модель не была развёрнута ни у одного Inference Provider на Hugging Face. (подтверждено первоисточником: доказательство; «This model isn’t deployed by any Inference Provider.»)
Первоисточники:
оценка 75.0 · тип release · ревизия 1 · истории st-11th3e4