TR-HASH-MoE-200M-130B
TR-HASH MoE 200M is a 201.2M-parameter decoder-only base language model with grouped-query attention, a shared SwiGLU path, and...
TR-HASH MoE 200M is a 201.2M-parameter decoder-only base language model with grouped-query attention, a shared SwiGLU path, and...
This model is a custom-code derivative of AxiomicLabs/GPT-X2-125M, adapted for experimental long-context causal language modeling and architecture research....
A 90M parameter language model with modern architecture improvements developed by Mistyoz AI. The easiest way to chat...
GPT с 62 миллионами параметров, предварительно обученный и настроенный с помощью инструкций, полностью на одном устройстве NVIDIA Jetson...
Этот репозиторий содержит неофициальное преобразование в формате GGUF его/эммы-5, реализованное с помощью llama.cpp. Оригинальная модель Emma-5 является разработкой...
Rain-v2 — 1 выпуск для RTX 4090. — Мощность: ≈100M — Мощность: 32 层解码器, 隐藏维 512, 8 头...
Эта модель была перезагружена для архивирования. Я никоим образом не связан с Егомнией и ее парнем. Немодифицированный файл...
KeyLM-75M-Instruct — это языковая модель с 75 млн параметров, настроенная на инструкции, обученная с нуля примерно на 18...