От автора патча llama.cpp: > Я начал работать над этим в качестве эксперимента и потому, что хотел попробовать модели Mamba с llama.cpp (к тому же уже было немало тонких настроек). Оказывается, реализовать поддержку новой архитектуры модели довольно весело (ну, по крайней мере, когда она наконец заработает). Самая мощная машина, на которой я тестирую LLM, — это маломощный ноутбук с 8 ГБ оперативной памяти и процессором Intel (без дискретного графического процессора), поэтому я не могу опробовать Mamba-3B во всей красе f32 (полные веса занимают 11 ГБ), но, по крайней мере, теперь можно использовать его в квантовом виде. > Постоянное использование памяти является большим преимуществом моделей Mamba, но это также означает, что не все предыдущие состояния сохраняются в памяти (по крайней мере, в текущей реализации сохраняется только последнее), что означает, что в примере с сервером может потребоваться более быстрая повторная обработка, чем необходимо, особенно если ваш клиент обрезает конец вывода (также проблематично, что стоп-токены не включаются в ответы сервера). В основном примере такой проблемы нет. > На данный момент начальная скорость генерации текста для Mamba немного медленнее, чем для моделей на основе Transformer (с пустым контекстом), но в отличие от них скорость Mamba…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: dranger003
Теги: gguf, endpoints_compatible
Лайков: 4 | Загрузок: 105
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.