Эта модель предоставляет несколько вариантов deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B, готовых к развертыванию на Android с использованием стека LiteRT (fka TFLite), MediaPipe LLM Inference API и LiteRt-LM. Отказ от ответственности: целевой поверхностью развертывания для моделей LiteRT является Android/iOS/Web, и стек оптимизирован для производительности на этих целях. Опробовать систему в Colab — это более простой способ ознакомиться со стеком LiteRT, с оговоркой, что производительность (память и задержка) в Colab может быть намного хуже, чем на локальном устройстве. Чтобы собрать демонстрационное приложение из исходного кода, следуйте инструкциям из репозитория GitHub. Обратите внимание, что вся статистика тестов взята из Samsung S24 Ultra с размером кэша 1280 КВ и несколькими включенными подписями предварительного заполнения. Длина контекста внутреннего квантования Предварительное заполнение (токен/сек) Декодирование (токен/сек) Время до получения первого токена (сек) Размер модели (МБ) Пиковая память RSS (МБ) Память графического процессора (МБ) CPU Dynamicint8 4096 166,50 tk/s 26,35 tk/s 6,41 с 1831,43 МБ 2221 МБ Н/Д GPU Dynamicint8 4096 927,54 такт/с 26,98 такт/с 5,46 с 1831,43 МБ 2096 МБ 1659 МБ Размер модели: измеряется размером плоского буфера .tflite (формат сериализации для моделей LiteRT) Память:…
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: litert-community
Теги: litert-lm, tflite, chat
Лайков: 35 | Загрузок: 27,952
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.