MedPsy-4B-GGUF предоставляет веса GGUF MedPsy-4B для быстрого вывода данных на устройстве через llama.cpp и QVAC SDK. Неквантованный файл BF16 GGUF (около 8,83 ГБ) включен вместе с семью форматами квантования: от 8-битного формата почти без потерь (около 4,69 ГБ) до высококачественного 5-битного варианта (около 3,16 ГБ) и до сверхкомпактного 3-битного файла (около 1,84 ГБ), что позволяет использовать одну и ту же модель на всех устройствах — от рабочих станций до мобильных устройств высокого класса. Все опубликованные файлы создаются с помощью llama.cpp. Файл BF16 GGUF не квантован: квантование не применяется. Мы отдельно не переоценивали GGUF BF16 с llama.cpp; поскольку он сохраняет ту же точность тензора BF16, что и исходная контрольная точка, ожидается, что производительность будет соответствовать исходной модели BF16, оцененной с помощью vLLM, за исключением небольших различий в серверной части или во время выполнения. Q80 не использует калибровку imatrix (мы убедились, что imatrix не дает ощутимых преимуществ при 8-битном разрешении). Во всех суб8-битных вариантах используется калибровка матрицы важности (imatrix)**, которая последовательно снижает ухудшение качества. См. технический отчет MedPsy (раздел 4.7) для получения полной методологии квантования, включая сравнение K-квантов и I-квантов и…
Модальности:
Генерация текста
Области применения:
Диалог / чат Медицина
Задача: Генерация текста
Автор: qvac
Теги: gguf, medical, healthcare, clinical, edge, qwen3, tether-ai, on-device
Лайков: 6 | Загрузок: 873
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.