Общая сводка по всем сценариям
Сценариев: 6
Моделей: 3
Критериев: 51
Лидер: DeepSeek
Рекомендована DeepSeek (K=0.691). Моделей: 3 · Критериев: 51.
Рейтинг моделей по всем сценариям
Метрики LLM по всем сценариям
Общая аналитика
Весовая структура критериев
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты.
Лидером в данном проекте является модель DeepSeek, которая показала наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Модель DeepSeek также показала наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры.
Модель Алиса AI заняла второе место, показав хорошие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Модель ChatGPT заняла третье место, показав средние результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Однако, стоит отметить, что модель DeepSeek показала наибольший разрыв в лидерстве по критериям точности ответа и логичности и структуры.
В целом, результаты показывают, что модель DeepSeek является наилучшим выбором для данного проекта, но также необходимо учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.
Рекомендуемая модель: DeepSeek.
Причина выбора: Наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Сильные стороны: Наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры.
Слабые стороны: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.
Риски: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.
Условия смены лидера: Если модель Алиса AI или ChatGPT покажут наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Практические выводы для LLM: Нужно учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.
Краткое резюме
Моделей: 3
Критериев: 1
Лидер: ChatGPT
Рекомендована ChatGPT (K=0.000) · Отрыв от DeepSeek: 0.000 · Пропуски: 1
Рейтинг моделей
Импорт оценок из CSV
Формат: model, criterion, score
Оценка по методике TOPSIS
TOPSIS появится после добавления моделей, критериев и оценок.
Почему победила модель
Победила ChatGPT с K=0.000.
Ближайший конкурент: DeepSeek (отрыв 0.000).
Визуализация
Весовая структура критериев
Анализ чувствительности
Пересчёт происходит автоматически при изменении ползунков.
Новый рейтинг при изменённых весах
Финальная сводка
Итоговый отчёт
Проект: Демо проект
Сценарий: Редактирование изображений
Рекомендуемая модель: ChatGPT
Интегральная оценка (K): 0.000
Интерпретация: Не рекомендуется к применению.
Почему именно эта модель:
- Ключевые критерии вклада: н/д
- Отрыв от второго места: 0.000
- Выбор чувствителен к изменениям весов.
- Ближайший конкурент: DeepSeek
- Пропуски в оценках лидера: 1
Условия, при которых выбор может измениться:
- Отрыв от второго места небольшой, поэтому выбор чувствителен к настройке весов.
- Есть пропуски в оценках — при их заполнении итог может поменяться.
Примечание: расчёт основан на включённых критериях и текущих весах.