Демо проект

Сравнение llm моделей в различных условиях

Моделей: 3 Критериев: 20 Лидер: Алиса AI

Сценарии (промпты)

Выберите отдельный сценарий или общую сводку по всем сценариям.

Придумай песню про разработчика

Общая сводка по всем сценариям

Сценариев: 6 Моделей: 3 Критериев: 51 Лидер: DeepSeek

Рекомендована DeepSeek (K=0.691). Моделей: 3 · Критериев: 51.

Рейтинг моделей по всем сценариям

Место Модель K Взвешенная сумма Интерпретация Пропуски
1 DeepSeek 0.691 19.350 Приемлемая модель, требуется доработка. 1
2 Алиса AI 0.602 16.850 Приемлемая модель, требуется доработка. 1
3 ChatGPT 0.564 15.800 Слабая модель, нужна настройка или замена. 1

Метрики LLM по всем сценариям

Модель Accuracy Precision Recall F1-score BLEU ROUGE-L BERTScore Perplexity
ChatGPT 0.576 0.608 0.544 0.574 0.558 0.567 0.574 38.9
DeepSeek 0.676 0.720 0.632 0.673 0.648 0.662 0.672 30.9
Алиса AI 0.584 0.592 0.576 0.584 0.566 0.575 0.582 38.3

Общая аналитика

Рейтинг по K
Весовая структура критериев
Профили лидеров
Вклад критериев лидера
Тепловая карта оценок
ComparatorAI Модель: meta/Meta-Llama-3.1-8B-Instruct · Обновлено: 2026-05-29 07:59:16
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты. 

Лидером в данном проекте является модель DeepSeek, которая показала наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. 

Модель DeepSeek также показала наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры. 

Модель Алиса AI заняла второе место, показав хорошие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. 

Модель ChatGPT заняла третье место, показав средние результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. 

Однако, стоит отметить, что модель DeepSeek показала наибольший разрыв в лидерстве по критериям точности ответа и логичности и структуры. 

В целом, результаты показывают, что модель DeepSeek является наилучшим выбором для данного проекта, но также необходимо учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера. 

Рекомендуемая модель: DeepSeek.

Причина выбора: Наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.

Сильные стороны: Наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры.

Слабые стороны: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.

Риски: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.

Условия смены лидера: Если модель Алиса AI или ChatGPT покажут наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.

Практические выводы для LLM: Нужно учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.

Краткое резюме

Моделей: 3 Критериев: 20 Лидер: Алиса AI

Рекомендована Алиса AI (K=0.726) · Ключевые критерии: Точность ответа, Логичность и структура · Отрыв от ChatGPT: 0.074


Рейтинг моделей

Место Модель K
1 Алиса AI 0.726
2 ChatGPT 0.653
3 DeepSeek 0.589

Критерии сценария

Творческий сценарий

Группа Критерий Описание Вес

Добавить критерии

Список моделей

Название Описание
ChatGPT Модель от openai
DeepSeek Модель от одноименной DeepSeek
Алиса AI Модель от Яндекса

Добавить модель

Библиотека моделей

Название Описание
DeepSeek Модель от одноименной DeepSeek
Гигачат Модель от Сбера
Алиса AI Модель от Яндекса
Claude Opus Модель от Anthropic
ChatGPT Модель от openai

Ввод оценок

Критерий ChatGPT DeepSeek Алиса AI
Точность ответа
Логичность и структура
Глубина и полнота ответа
Гибкость в интерпретации
Адекватность формата
Чувствительность к контексту
Креативность
Скорость ответа
Адаптивность к стилю общения
Обработка сложных запросов
Восприятие неоднозначности
Оценка релевантности источников
Эффективность исправления ошибок
Понимание технической специфики
Устойчивость к когнитивной нагрузке
Интерактивность
Анализ и синтез информации
Поддержка мультимодальных запросов
Работа с ограниченными данными
Контекстная согласованность

Импорт оценок из CSV

Формат: model, criterion, score

Рейтинг моделей

Место Модель K Взвешенная сумма Интерпретация Пропуски
1 Алиса AI 0.726 6.900 Приемлемая модель, требуется доработка. 0
2 ChatGPT 0.653 6.200 Приемлемая модель, требуется доработка. 0
3 DeepSeek 0.589 5.600 Слабая модель, нужна настройка или замена. 0

Метрики оценки LLM

Модель Accuracy Precision Recall F1-score BLEU ROUGE-L BERTScore Perplexity
ChatGPT 0.640 0.714 0.600 0.652 0.616 0.628 0.637 33.8
DeepSeek 0.620 0.629 0.615 0.622 0.598 0.609 0.618 35.4
Алиса AI 0.680 0.714 0.662 0.687 0.652 0.666 0.676 30.6

Оценка по методике TOPSIS

Место Модель TOPSIS C
1 Алиса AI 0.660
2 ChatGPT 0.395
3 DeepSeek 0.317

C ближе к 1 означает, что модель ближе к идеальному решению и дальше от анти-идеального.

Вклад критериев

Критерий Вес Оценка Вклад
Точность ответа 0.30 5 1.500
Логичность и структура 0.20 3 0.600
Глубина и полнота ответа 0.20 3 0.600
Гибкость в интерпретации 0.10 4 0.400
Адекватность формата 0.05 3 0.150
Чувствительность к контексту 0.05 1 0.050
Креативность 0.05 5 0.250
Скорость ответа 0.05 3 0.150
Адаптивность к стилю общения 0.05 5 0.250
Обработка сложных запросов 0.10 5 0.500
Восприятие неоднозначности 0.05 4 0.200
Оценка релевантности источников 0.05 2 0.100
Эффективность исправления ошибок 0.05 1 0.050
Понимание технической специфики 0.10 2 0.200
Устойчивость к когнитивной нагрузке 0.10 5 0.500
Интерактивность 0.05 5 0.250
Анализ и синтез информации 0.10 5 0.500
Поддержка мультимодальных запросов 0.10 2 0.200
Работа с ограниченными данными 0.10 4 0.400
Контекстная согласованность 0.05 1 0.050

Сильные и слабые стороны

Модель Сильные стороны Слабые стороны Пропуски
Алиса AI Точность ответа (оценка 5, вклад 1.50); Логичность и структура (оценка 3, вклад 0.60); Глубина и полнота ответа (оценка 3, вклад 0.60) Чувствительность к контексту (оценка 1, вклад 0.05); Эффективность исправления ошибок (оценка 1, вклад 0.05); Контекстная согласованность (оценка 1, вклад 0.05) 0
ChatGPT Логичность и структура (оценка 5, вклад 1.00); Глубина и полнота ответа (оценка 5, вклад 1.00); Обработка сложных запросов (оценка 5, вклад 0.50) Адекватность формата (оценка 1, вклад 0.05); Адаптивность к стилю общения (оценка 1, вклад 0.05); Восприятие неоднозначности (оценка 1, вклад 0.05) 0
DeepSeek Точность ответа (оценка 2, вклад 0.60); Анализ и синтез информации (оценка 5, вклад 0.50); Работа с ограниченными данными (оценка 5, вклад 0.50) Скорость ответа (оценка 1, вклад 0.05); Эффективность исправления ошибок (оценка 1, вклад 0.05); Интерактивность (оценка 1, вклад 0.05) 0

Почему победила модель

Победила Алиса AI с K=0.726.
Ближайший конкурент: ChatGPT (отрыв 0.074).
Критерий Лидер Конкурент Разрыв (вес)
Точность ответа 5 1 1.200
Логичность и структура 3 5 -0.400
Глубина и полнота ответа 3 5 -0.400
Гибкость в интерпретации 4 3 0.100
Адекватность формата 3 1 0.100
Чувствительность к контексту 1 4 -0.150

Визуализация

Рейтинг по K
Весовая структура критериев
Профили лидеров
Вклад критериев лидера
Тепловая карта оценок

Анализ чувствительности

Пересчёт происходит автоматически при изменении ползунков.

Новый рейтинг при изменённых весах

Место Модель K
1 Алиса AI 0.726
2 ChatGPT 0.653
3 DeepSeek 0.589

Финальная сводка

Итоговый отчёт
Проект: Демо проект
Сценарий: Творческий сценарий

Рекомендуемая модель: Алиса AI
Интегральная оценка (K): 0.726
Интерпретация: Приемлемая модель, требуется доработка.

Почему именно эта модель:
- Ключевые критерии вклада: Точность ответа, Логичность и структура, Глубина и полнота ответа
- Отрыв от второго места: 0.074
- Выбор выглядит стабильным.
- Ближайший конкурент: ChatGPT
- Наибольшее преимущество по критериям: Точность ответа, Адаптивность к стилю общения, Устойчивость к когнитивной нагрузке
- Где лидер уступает: Логичность и структура, Глубина и полнота ответа, Понимание технической специфики
- Сильные стороны лидера: Точность ответа (оценка 5, вклад 1.50), Логичность и структура (оценка 3, вклад 0.60), Глубина и полнота ответа (оценка 3, вклад 0.60)
- Слабые стороны лидера: Чувствительность к контексту (оценка 1, вклад 0.05), Эффективность исправления ошибок (оценка 1, вклад 0.05), Контекстная согласованность (оценка 1, вклад 0.05)

Условия, при которых выбор может измениться:
- Если повысить веса критериев, где сильнее ChatGPT (Логичность и структура, Глубина и полнота ответа, Понимание технической специфики), лидер может измениться.

Примечание: расчёт основан на включённых критериях и текущих весах.