Общая сводка по всем сценариям
Сценариев: 6
Моделей: 3
Критериев: 51
Лидер: DeepSeek
Рекомендована DeepSeek (K=0.691). Моделей: 3 · Критериев: 51.
Рейтинг моделей по всем сценариям
Метрики LLM по всем сценариям
Общая аналитика
Весовая структура критериев
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты.
Лидером в данном проекте является модель DeepSeek, которая показала наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Модель DeepSeek также показала наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры.
Модель Алиса AI заняла второе место, показав хорошие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Модель ChatGPT заняла третье место, показав средние результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Однако, стоит отметить, что модель DeepSeek показала наибольший разрыв в лидерстве по критериям точности ответа и логичности и структуры.
В целом, результаты показывают, что модель DeepSeek является наилучшим выбором для данного проекта, но также необходимо учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.
Рекомендуемая модель: DeepSeek.
Причина выбора: Наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Сильные стороны: Наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры.
Слабые стороны: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.
Риски: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.
Условия смены лидера: Если модель Алиса AI или ChatGPT покажут наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.
Практические выводы для LLM: Нужно учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.
Краткое резюме
Моделей: 3
Критериев: 10
Лидер: DeepSeek
Рекомендована DeepSeek (K=0.750) · Ключевые критерии: Глубина и полнота ответа, Точность ответа · Отрыв от Алиса AI: 0.200
Рейтинг моделей
Импорт оценок из CSV
Формат: model, criterion, score
Оценка по методике TOPSIS
C ближе к 1 означает, что модель ближе к идеальному решению и дальше от анти-идеального.
Почему победила модель
Победила DeepSeek с K=0.750.
Ближайший конкурент: Алиса AI (отрыв 0.200).
Визуализация
Весовая структура критериев
Анализ чувствительности
Пересчёт происходит автоматически при изменении ползунков.
Новый рейтинг при изменённых весах
Финальная сводка
Итоговый отчёт
Проект: Демо проект
Сценарий: Безумный сценарий
Рекомендуемая модель: DeepSeek
Интегральная оценка (K): 0.750
Интерпретация: Хорошая модель, подходит для большинства задач.
Почему именно эта модель:
- Ключевые критерии вклада: Глубина и полнота ответа, Точность ответа, Логичность и структура
- Отрыв от второго места: 0.200
- Выбор выглядит стабильным.
- Ближайший конкурент: Алиса AI
- Наибольшее преимущество по критериям: Логичность и структура, Глубина и полнота ответа, Точность ответа
- Где лидер уступает: Чувствительность к контексту, Контекстная согласованность
- Сильные стороны лидера: Глубина и полнота ответа (оценка 5, вклад 1.00), Точность ответа (оценка 3, вклад 0.90), Логичность и структура (оценка 4, вклад 0.80)
- Слабые стороны лидера: Контекстная согласованность (оценка 1, вклад 0.05), Чувствительность к контексту (оценка 2, вклад 0.10), Адекватность формата (оценка 3, вклад 0.15)
Условия, при которых выбор может измениться:
- Если повысить веса критериев, где сильнее Алиса AI (Чувствительность к контексту, Контекстная согласованность), лидер может измениться.
Примечание: расчёт основан на включённых критериях и текущих весах.