Мы представляем VisionReward, общую стратегию согласования моделей визуальной генерации (как изображений, так и видео) с предпочтениями человека с помощью мелкозернистой и многомерной структуры. Мы разлагаем человеческие предпочтения в изображениях и видео на несколько измерений, каждое из которых представлено серией оценочных вопросов, линейно взвешенных и суммируемых для получения интерпретируемого и точного результата. Чтобы решить проблемы оценки качества видео, мы систематически анализируем различные динамические характеристики видео, что помогает VisionReward превзойти VideoScore на 17,2% и достичь максимальной производительности в прогнозировании предпочтений видео. Здесь мы представляем модель VisionReward-Video. Вы можете быстро установить зависимости пакета Python и запустить вывод модели в нашем GitHub.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: zai-org
Теги: chat, cogvlm2, cogvlm—video, conversational, custom_code, en
Лайков: 8 | Загрузок: 2,049
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.