LiquidAI/LFM2.5-350M-ONNX - Каталог нейросетей
Генерация текста

LiquidAI/LFM2.5-350M-ONNX

Добавлено:
LiquidAI/LFM2.5-350M-ONNX

В четвертом квартале используется GatherBlockQuantized для внедрения токенов и MatMulNBits для lm_head, повторно используя те же квантованные веса и масштабы. Все остальные линейные слои квантуются до INT4 с помощью постэкспортного MatMulNBitsQuantizer. Размер блока равен 32. Q4F32 сохраняет встраивание как FP32 Gather, а lm_head как FP32 Transpose + MatMul. Только внутренние линейные слои (проекции внимания, проекции конв, MLP) квантуются до INT4 с помощью постэкспортного MatMulNBitsQuantizer. Q8 имеет ту же структуру, что и Q4F32, но с весами INT8 (асимметричное квантование). 1. Chrome/Edge: перейдите к chrome://flags/#enable-unsafe-webgpu, включите и перезапустите 2. Проверьте: проверьте chrome://gpu на наличие статуса «WebGPU» 3. Тестируйте: запустите navigator.gpu.requestAdapter() в консоли DevTools. Модели используют внешние файлы данных (.onnxdata), которые загружаются автоматически. Для тензоров int64 требуется BigInt64Array`

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: LiquidAI
Теги: onnx, lfm2, liquid, edge, lfm2.5, onnxruntime, webgpu, conversational
Лайков: 10  |  Загрузок: 320

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.