Это Huginn, версия 25 января, модель скрытой рекуррентной глубины с параметрами 3,5B, обученная для токенов 800B на машинах AMD MI250X. Это модель для проверки концепции, но она на удивление способна рассуждать и кодировать, учитывая бюджет и размер обучения. Все подробности об этой модели можно найти в техническом отчете: «Масштабирование вычислений во время тестирования с помощью скрытого рассуждения: метод рекуррентной глубины». (https://www.arxiv.org/abs/2502.05171) Для получения дополнительной информации см. страницу документа: https://huggingface.co/papers/2502.05171. В коллекции можно найти 8 промежуточных контрольных точек модели. Дополнительные промежуточные контрольные точки доступны по запросу, пока мы не найдем место для их размещения примерно 350 из них. Данные, используемые для обучения этой модели, общедоступны (полностью доступны на Hugging Face), а сценарии, предоставленные с кодом предварительного обучения по адресу https://github.com/seal-rg/recurrent-pretraining, могут использоваться для повторения нашей предварительной обработки и всего цикла обучения. 1. Как использовать 2. Расширенное использование 3. Сводная информация о модели 4. Ограничения 5. Технические детали 6. Лицензия 7. Цитирование. Указав аргумент numsteps`, модель выполнит прямой проход с таким объемом вычислений: Модель имеет около 1,5 млрд параметров в…
Модальности:
Генерация текста
Области применения:
Генерация кода Математика Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: tomg-group-umd
Теги: huginn_raven, code, math, reasoning, llm, conversational, custom_code, en
Лайков: 294 | Загрузок: 4,194
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.