Эта модель предоставляет несколько вариантов TinyLlama/TinyLlama-1.1B-Chat-v1.0, которые готовы к развертыванию на Android с использованием стека LiteRT (fka TFLite) и API MediaPipe LLM Inference. Отказ от ответственности: целевой поверхностью развертывания для моделей LiteRT является Android/iOS/Web, и стек был оптимизирован для производительности этих целей. Опробование системы в Colab — это более простой способ ознакомиться со стеком LiteRT с оговоркой, что производительность (память и задержка) в Colab может быть намного хуже, чем на локальном устройстве. Чтобы создать демо-приложение из исходного кода, следуйте инструкциям из репозитория GitHub. Обратите внимание, что все эталонные статистические данные взяты из Samsung S24 Ultra с размером кэша 1280 КВ с включенными подписями нескольких предварительных заполнений. Backend Prefill (tokens/sec) Decode (tokens/sec) Time-to-first-token (sec) Memory (RSS in MB) Model size (MB) fp32 (baseline) cpu 51.14 tk/s 9.23 tk/s 9.25 s 6,155 MB 4,208 MB dynamic_int8 cpu 156.10 tk/s 26.34 tk/s 3.80 s 2,359 MB 1,095 MB Model Size: measured by the size of the .tflite flatbuffer (serialization format for LiteRT models) Memory: indicator of peak RAM use The inference on CPU is accelerated through the LiteRT…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: litert-community
Теги: litert-lm, tflite, chat
Лайков: 4 | Загрузок: 964
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.