DeepSeek-V4.1-Flash
Мультимодальная открытая модель на 552 млрд параметров с контекстом в миллион токенов
Огромные контекстные окна обычно съедают видеопамять за считанные секунды. DeepSeek-V4.1-Flash обходит эту проблему радикальной оптимизацией: при общем массиве в 552 миллиарда параметров архитектура активирует всего 8 миллиардов на токен при чтении промпта и 16 миллиардов при генерации текста. Модель нативно считывает изображения вместе с текстом и держит в рабочей памяти до одного миллиона токенов.
Что умеет
- Работать с изображениями и текстом. Встроенный визуальный энкодер DeepSeek-ViT оцифровывает картинки и связывает их с текстовыми токенами напрямую.
- Держать длинный контекст. Архитектура Causal Encoder-Decoder позволяет без потери фокуса анализировать массивы данных объёмом до 1 000 000 токенов.
- Экономить память. Алгоритм сжатия CSA2 и хранение кеша в формате FP4 ужимают глобальный след до 890 байт на токен — в четыре раза скромнее прошлой версии Flash.
- Регулировать время на ответ. В модель встроен числовой регулятор рассуждений от 1 до 100, позволяющий балансировать между скоростью выдачи и дотошностью анализа.
- Интегрироваться в пайплайны. Готовые скрипты кодирования и библиотека deepseek-recipe поддерживают вызовы сторонних инструментов, работу с разметкой рассуждений и чередование картинок в одном диалоге.
Цены и доступ
Веса модели и репозиторий полностью открыты под лицензией MIT. Запустить генерацию можно локально на собственном оборудовании, следуя инструкциям по конвертации весов.
В связке с продакшен-процессами модель снимает вечный барьер между гигантским объёмом вводных данных и серверными бюджетами. Нас подкупило, что теперь можно загрузить в один запрос увесистый бриф, пачку референсов и сложный сценарий, не боясь уронить рабочую станцию. Масштаб перестал требовать бесконечного железа.

