jcbtc/Laguna-S-2.1-NVFP4-GGUF - Каталог нейросетей
Генерация текста

jcbtc/Laguna-S-2.1-NVFP4-GGUF

Добавлено:
jcbtc/Laguna-S-2.1-NVFP4-GGUF

Всего 117,6 млрд параметров, около 8,5 млрд активных на токен и до 262 144 контекстов токенов на 32 ГБ RTX 5090 с 64 ГБ системной оперативной памяти. Это собственная контрольная точка NVFP4 Laguna S 2.1 от Poolside, упакованная как один GGUF 67,03 ГиБ для llama.cpp. Автоматическое размещение ЦП/ГП с учетом тензоров сохраняет плотный путь выполнения и выбранные тензоры на ГП, одновременно перегружая экспертные веса в ОЗУ. Он не использует DFlash или спекулятивное декодирование. Включенная коррекция времени выполнения соединяет собственные тензоры масштаба NVFP4 Laguna с каждым соответствующим путем графа. Результатом является практическое развертывание для Blackwell с длинным контекстом, а не меньшая, отдельно переквантованная контрольная точка. Строки размером 64 КБ и 128 КБ — это полностью занятые некэшированные семантические тесты, а не пустые выделения KV-кэша. Профиль 256K допускает полный слот на 262 144 токена и генерирует согласованно; полностью занятый семантический проход 256К здесь пока не заявлен. 1201,93 токена/с — это самый быстрый измеренный результат обработки/предварительного заполнения, полученный для полного приглашения из 65 269 токенов с отдельно настроенным профилем скорости пакета 1024 / ubatch 1024 64K. Это не скорость выходного токена. Измеренная генерация выходного сигнала составляет 18,68–27,81 ток/с, в зависимости от конфигурации…

Модальности:
Генерация текста

Области применения:
Диалог / чат Вызов функций (Tool use)


Задача: Генерация текста
Автор: jcbtc
Теги: llama.cpp, gguf, laguna, laguna-s-2.1, nvfp4, blackwell, rtx-5090, moe
Лайков: 5  |  Загрузок: 1,232

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.