Крошечный, полностью автономный сервер с расширенной генерацией данных. Он включает в себя небольшую языковую модель GGUF (Pleias Redline, доработанная версия Baguettotron, ~300M параметров) с полнотекстовым поиском LanceDB за минимальным API Flask — и полностью работает на ЦП, в том числе на Raspberry Pi 5. Без графического процессора. Никаких внешних вызовов API. Никакие данные не покидают машину. Код, примеры баз данных и веса моделей находятся в этом репозитории, поэтому один клон дает вам работающую систему. Задайте вопрос → сервер извлекает наиболее релевантные отрывки из локальной базы данных → модель читает их и возвращает обоснованный ответ. — На устройстве и в автономном режиме — вывод только о процессоре через llama.cpp, без сети во время выполнения. — Потоковая передача — ответы на поток по токену в текстовом/обычном виде. — Принесите свои собственные данные: «таблица» — это просто папка в каталоге набора данных; вставьте свой и запросите его по имени. — Две конечные точки — одна с поиском, другая для прямой подачи источников (тестирование). Входящая в комплект модель — Pleias Redline (Pleias-RAG.gguf), версия Baguettotron с точной настройкой параметров ~300M, квантованная до Q80 (328 МБ). Это модель RAG в стиле рассуждения: она думает внутри блока, а затем отвечает встроенными цитатами. Учитывая вопрос…
Модальности:
Генерация текста
Области применения:
RAG (поиск + генерация)
Задача: Генерация текста
Автор: PleIAs
Теги: gguf, rag, retrieval-augmented-generation, llama-cpp, flask, raspberry-pi, on-device, edge
Лайков: 5 | Загрузок: 135
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.