TeenyTinyLlama-460m-Chat
TeenyTinyLlama — это пара небольших базовых моделей, обучаемых на бразильском португальском языке. Этот репозиторий содержит версию TeenyTinyLlama-460m (TeenyTinyLlama-460m-Chat),...
TeenyTinyLlama — это пара небольших базовых моделей, обучаемых на бразильском португальском языке. Этот репозиторий содержит версию TeenyTinyLlama-460m (TeenyTinyLlama-460m-Chat),...
This repo contains the model checkpoints for: — model family llama13b — optimized with the loss SFT+KTO —...
Aira-2 is the second version of the Aira instruction-tuned series. Aira-2-portuguese-124M is an instruction-tuned model based on GPT-2....
Aira-2 is the second version of the Aira instruction-tuned series. Aira-2-774M is an instruction-tuned model based on GPT-2....
Instead of training an additional reward model that is likely to be gamed, we directly train the model...
Ориентированная на выравнивание тонкая настройка DeepSeek-R1-Distill-Qwen-1.5B. Улучшение выравнивания измеряется прозрачно с использованием фреймворка Bloom от Anthropic. Три из...
 ![Language]()  The model was sculpted through a rigorous multi-stage process: Objective: Instill...
Независимая исследовательская лаборатория ИИ строит безопасные, устойчивые языковые модели, оптимизированные для совместной работы человека и ИИ Версия: Предварительный...
Безопасное выравнивание практически устранено за счет многопроходной абляции и подавления токенов для исследования безопасности. Целевые три верхних слоя...
Он имеет кодирование, обоснование, китайский контроль качества и функцию безопасного отказа. Я опубликовал набор данных в стиле альпаки...