Veyra2-Mango-15M-Base
Veyra2-Mango-15M-Base is a 15.7M-parameter Llama-like causal language model trained from scratch on approximately 30B tokens. It is a...
Veyra2-Mango-15M-Base is a 15.7M-parameter Llama-like causal language model trained from scratch on approximately 30B tokens. It is a...
RWKV7-2.9B-20260805 RWKV-7 «GOOSE» · постоянное рекуррентное языковое моделирование Нативная регистрация автокласса rwkv7 требует Transformers 5.15 или проверки источника...
ObsidianSmall-Base is an 8.7M-parameter English base language model pretrained from scratch on 3,999,989,760 tokens. It is the first...
BananaMind-2-Mini-Chat is the instruction-tuned version of BananaMind-2-Mini. It was fully fine-tuned on HuggingFaceTB/smol-smoltalk with loss applied only to...
A ~50M-parameter Mamba (selective state-space) causal language model, pretrained from scratch on English Wikipedia. Mamba replaces the attention...
BananaMind-KV1-8M-2Bit-Experimental is a Hugging Face Transformers causal language model repository for the first Project KV1 checkpoint. This is...
MiniBananaMind-v3-9M is a small causal language model trained from scratch on FineWeb-Edu and FineMath. The model has about...
Atom is a 3.4M parameter causal language model developed by Universal Computing Research. It was pretrained from scratch...
Hiro-Pharma is a causal language model based on Qwen/Qwen2.5-7B. It is released in safetensors format under the Apache...
Quark-270M Base — это компактная двуязычная языковая модель для итальянского и английского языков, построенная полностью с нуля компанией...