ByteDance-Seed/cudaLLM-8B - Каталог нейросетей
Генерация текста

ByteDance-Seed/cudaLLM-8B

Добавлено:
ByteDance-Seed/cudaLLM-8B

cudaLLM-8B — языковая модель для генерации высокопроизводительных и синтаксически правильных ядер CUDA. Он основан на модели Qwen3-8B и прошел двухэтапный процесс обучения для освоения сложностей параллельного программирования для графических процессоров. Модель обучалась с использованием библиотеки verl. Модель была обучена и оценена на: — Наборе данных SFT: высококачественном наборе данных пар проблем-решений CUDA (sftcudallmr1.parquet), первоначально созданном DeepSeek R1, DeepSeel Coder-7B и Qwen2-32B. — Набор данных RL: уточненный набор данных (rlcudallm0424.parquet), используемый для предоставления вознаграждений в зависимости от производительности на этапе RL. — Набор оценочных данных: производительность модели сравнивалась с набором данных KernelBench. Основное использование CudaLLM — помощь разработчикам в написании и оптимизации высокопроизводительных ядер CUDA. Его можно использовать для: — Ускорения научных вычислений и рабочих нагрузок машинного обучения. — В качестве второго пилота или инструмента повышения производительности для разработчиков HPC и CUDA. — Исследования в области генерации и оптимизации кода с помощью искусственного интеллекта. — Корректность не гарантируется: несмотря на то, что модель обучена создавать правильный код, выходные данные модели всегда должны тщательно тестироваться и проверяться перед развертыванием в…

Модальности:
Генерация текста

Области применения:
Генерация кода Диалог / чат


Задача: Генерация текста
Автор: ByteDance-Seed
Теги: qwen3, code, CUDA, conversational
Лайков: 28  |  Загрузок: 87

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.