Llama-2-7b-chat-hf-hosted-inference-8bit
Это просто 8-битная версия модели Ламы-2-7Б. — 8-бит позволяет модели иметь размер менее 10 ГБ. — Это позволяет...
Это просто 8-битная версия модели Ламы-2-7Б. — 8-бит позволяет модели иметь размер менее 10 ГБ. — Это позволяет...
Это версия hivemind/gpt-j-6B-8bit для загрузки с низким объемом оперативной памяти, т. е. бесплатная среда выполнения Colab 🙂 Для...
4-битный квант MLX смешанной точности, созданный mlx-optiq, набором инструментов квантования с учетом чувствительности для Apple Silicon. Оценка +6,40...
4-битный квант MLX смешанной точности, созданный mlx-optiq — набором инструментов квантования с учетом чувствительности для Apple Silicon. Превосходит...
4-битный квант MLX смешанной точности, созданный mlx-optiq — набором инструментов квантования с учетом чувствительности для Apple Silicon. Превосходит...
Статическое квантование Llama.cpp nvidia/Llama-3.1-Minitron-4B-Width-Base Исходная модель: nvidia/Llama-3.1-Minitron-4B-Width-Base Исходный тип dtype: BF16 (bfloat16) Квантование: llama.cpp b3600 Набор данных IMatrix:...
> Оптимизирован для Apple Silicon с помощью mlx-optiq — квантование смешанной точности с учетом чувствительности, возможность повторного использования...
> Оптимизирован для Apple Silicon с помощью mlx-optiq — квантование смешанной точности с учетом чувствительности, возможность повторного использования...