Точная настройка «LFM2-8B-A1B» с помощью Unsloth с использованием пользовательских наборов данных, контекст 128 КБ с точностью до 16 бит. Эта модель представляет собой редкую смесь моделей экспертов (32) с 4 активированными экспертами. Скорость превышает 50-100 т/с на CPU // 200 т/с на большинстве карт // 400 т/с + на 5090 у QUANT Q6K [4 эксперта]. LFM2-8B-A1B-GLM-4.7-Flash-Thinking-Quantum-IQ1C-P q8-hi 0.529,0.744,0.745,0.658,0.412,0.760,0.597 LFM2-8B-A1B-GLM-4.7-Flash-Thinking-Quantum-IQ1C mxfp8 0,495,0,709,0,759,0,658,0,404,0,764,0,596
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: DavidAU
Теги: lfm2_moe, finetune, unsloth, mixture of experts, sparse moe, moe, heretic, uncensored
Лайков: 7 | Загрузок: 144
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.