mamba-50m
A ~50M-parameter Mamba (selective state-space) causal language model, pretrained from scratch on English Wikipedia. Mamba replaces the attention...
A ~50M-parameter Mamba (selective state-space) causal language model, pretrained from scratch on English Wikipedia. Mamba replaces the attention...
Квантование MLX nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 для Apple Silicon. — Apple Silicon Mac с унифицированной памятью 128 ГБ — mlx-lm >=...
BitMamba-2-255M is the ultra-efficient baseline model of the BitMamba-2 family. It integrates 1.58-bit ternary quantization (BitNet) into the...
This is a hybrid Mamba-Transformer model based on the Llama 3.1 architecture, distilled from Llama 3.3 70B into...
Это гибридная модель Mamba-Transformer, основанная на архитектуре Llama 3.2, перегоненная из Llama 3.1 8B в модель параметров 3B...
MiniPLM-Mamba-130M is a 130M parameter language model with the Mamba architecture pre-trained from scratch on the Pile using...
Это экспериментальная модель, которая недостаточно обучена. — Тип модели: Mamba — Язык(и) (NLP): Японский — Токенизатор: ku-nlp/gpt2-large-japanese-char —...
我们训练的Mamba模型专注中文, pretrain使用的基本都是优质中文书籍语料。如果你喜欢我们的模型,帮我们点个小心心吧! Модальности:Генерация текста Области применения:Диалог / чат Задача: Генерация текста Автор: gywy Теги: mamba, conversational, text-generation-inference, endpoints_compatibleЛайков:...
Этот репозиторий содержит трансформеры, совместимые с mamba-2.8b. Контрольные точки не тронуты, но полный файл config.json и токенизатор перенесены...
> Привет, я ищу новую работу. Работаю в компании уже около года. Вы должны использовать этот класс для...