— Архитектура модели: Mistral-Small-24B-Instruct-2501 — Вход: Текст — Выход: Текст — Оптимизация модели: — Квантование веса: INT8 — Квантование активации: INT8 — Дата выпуска: 12.02.2025 — Версия: 1.0 — Разработчики модели: Elias Oenal Эта модель была получена путем квантования весов и активаций до типа данных W8A8, готового к выводу с помощью vLLM. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Только веса и активации линейных операторов в блоках трансформаторов квантуются. Эту модель можно эффективно развернуть с помощью бэкенда vLLM. Эта модель была создана с помощью llm-компрессора и набора данных neuralmagic/LLMcompressioncalibration.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: EliasOenal
Теги: mistral, mistral-small, w8a8, vllm, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.