Демо проект (резерв копия)

Сравнение llm моделей в различных условиях

Моделей: 3 Критериев: 10 Лидер: DeepSeek

Сценарии (промпты)

Выберите отдельный сценарий или общую сводку по всем сценариям.

Как приготовить свиные крылышки?

Общая сводка по всем сценариям

Сценариев: 4 Моделей: 3 Критериев: 50 Лидер: DeepSeek

Рекомендована DeepSeek (K=0.704). Моделей: 3 · Критериев: 50.

Рейтинг моделей по всем сценариям

Место Модель K Взвешенная сумма Интерпретация Пропуски
1 DeepSeek 0.704 19.350 Приемлемая модель, требуется доработка. 0
2 Алиса AI 0.613 16.850 Приемлемая модель, требуется доработка. 0
3 ChatGPT 0.575 15.800 Слабая модель, нужна настройка или замена. 0

Метрики LLM по всем сценариям

Модель Accuracy Precision Recall F1-score BLEU ROUGE-L BERTScore Perplexity
ChatGPT 0.576 0.608 0.544 0.574 0.558 0.567 0.574 38.9
DeepSeek 0.676 0.720 0.632 0.673 0.648 0.662 0.672 30.9
Алиса AI 0.584 0.592 0.576 0.584 0.566 0.575 0.582 38.3

Общая аналитика

Рейтинг по K
Весовая структура критериев
Профили лидеров
Вклад критериев лидера
Тепловая карта оценок
ComparatorAI Модель: meta/Meta-Llama-3.1-8B-Instruct · Обновлено: 2026-05-28 22:07:13
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты. 

Лидером по итогам оценки стал модуль DeepSeek, набравший 19,35 баллов из 50 возможных. На втором месте расположилась модель Алиса AI с результатом 16,85 баллов, а на третьем месте оказался ChatGPT с результатом 15,8 баллов. 

Оценка моделей была проведена по пяти критериям: точность ответа, логичность и структура, глубина и полнота ответа, гибкость в интерпретации и обработка сложных запросов. 

По каждому критерию модуль DeepSeek демонстрирует наибольшую эффективность, что подтверждается оценками по метрикам точности, логичности и глубины ответа. 

Модель Алиса AI также показывает хорошие результаты, особенно по критериям точности и глубины ответа. Однако, она демонстрирует некоторые слабые стороны, такие как адекватность формата и чувствительность к контексту. 

Модель ChatGPT, наоборот, демонстрирует хорошие результаты по критериям логичности и структуры, но слабые результаты по критериям точности и глубины ответа. 

В ходе оценки также были выявлены некоторые риски и условия, при которых лидерство может быть изменено. Например, если модуль DeepSeek демонстрирует хорошие результаты по критериям гибкости в интерпретации и обработки сложных запросов, то его лидерство может быть оспорено. 

В заключение, модуль DeepSeek демонстрирует наибольшую эффективность и лидерство в ходе сравнения моделей LLM в различных условиях. Однако, необходимо продолжить наблюдение за моделями и их развитием, чтобы определить, какая модель будет наиболее эффективной в долгосрочной перспективе. 

Рекомендация: модуль DeepSeek является наиболее эффективной моделью в ходе сравнения моделей LLM в различных условиях. 

Причины выбора: модуль DeepSeek демонстрирует наибольшую эффективность по всем критериям и метрикам. 

Сильные стороны: модуль DeepSeek демонстрирует хорошие результаты по критериям точности, логичности и глубины ответа. 

Слабые стороны: модуль DeepSeek демонстрирует некоторые слабые стороны, такие как гибкость в интерпретации и обработка сложных запросов. 

Риски: модуль DeepSeek демонстрирует хорошие результаты по критериям гибкости в интерпретации и обработки сложных запросов, что может привести к оспариванию его лидерства. 

Условия смены лидера: модуль DeepSeek может потерять лидерство, если он демонстрирует хорошие результаты по критериям гибкости в интерпретации и обработки сложных запросов. 

Практические выводы для LLM: модуль DeepSeek демонстрирует наибольшую эффективность и лидерство в ходе сравнения моделей LLM в различных условиях. Однако, необходимо продолжить наблюдение за моделями и их развитием, чтобы определить, какая модель будет наиболее эффективной в долгосрочной перспективе.

Краткое резюме

Моделей: 3 Критериев: 10 Лидер: DeepSeek

Рекомендована DeepSeek (K=0.792) · Ключевые критерии: Точность ответа, Логичность и структура · Отрыв от ChatGPT: 0.217


Рейтинг моделей

Место Модель K
1 DeepSeek 0.792
2 ChatGPT 0.575
3 Алиса AI 0.433

Критерии сценария

Логический сценарий

Группа Критерий Описание Вес

Добавить критерии

Список моделей

Название Описание
ChatGPT Модель от openai
DeepSeek Модель от одноименной DeepSeek
Алиса AI Модель от Яндекса

Добавить модель

Библиотека моделей

Название Описание
DeepSeek Модель от одноименной DeepSeek
Гигачат Модель от Сбера
Алиса AI Модель от Яндекса
Claude Opus Модель от Anthropic
ChatGPT Модель от openai

Ввод оценок

Критерий ChatGPT DeepSeek Алиса AI
Точность ответа
Логичность и структура
Глубина и полнота ответа
Гибкость в интерпретации
Адекватность формата
Чувствительность к контексту
Креативность
Обработка сложных запросов
Понимание технической специфики
Контекстная согласованность

Импорт оценок из CSV

Формат: model, criterion, score

Рейтинг моделей

Место Модель K Взвешенная сумма Интерпретация Пропуски
1 DeepSeek 0.792 4.750 Хорошая модель, подходит для большинства задач. 0
2 ChatGPT 0.575 3.450 Слабая модель, нужна настройка или замена. 0
3 Алиса AI 0.433 2.600 Слабая модель, нужна настройка или замена. 0

Метрики оценки LLM

Модель Accuracy Precision Recall F1-score BLEU ROUGE-L BERTScore Perplexity
ChatGPT 0.600 0.533 0.700 0.605 0.580 0.590 0.598 37.0
DeepSeek 0.740 0.767 0.700 0.732 0.706 0.723 0.735 25.8
Алиса AI 0.400 0.467 0.300 0.365 0.400 0.400 0.402 53.0

Оценка по методике TOPSIS

Место Модель TOPSIS C
1 DeepSeek 0.799
2 ChatGPT 0.521
3 Алиса AI 0.296

C ближе к 1 означает, что модель ближе к идеальному решению и дальше от анти-идеального.

Вклад критериев

Критерий Вес Оценка Вклад
Точность ответа 0.30 4 1.200
Логичность и структура 0.20 5 1.000
Глубина и полнота ответа 0.20 5 1.000
Гибкость в интерпретации 0.10 1 0.100
Адекватность формата 0.05 5 0.250
Чувствительность к контексту 0.05 4 0.200
Креативность 0.05 1 0.050
Обработка сложных запросов 0.10 4 0.400
Понимание технической специфики 0.10 3 0.300
Контекстная согласованность 0.05 5 0.250

Сильные и слабые стороны

Модель Сильные стороны Слабые стороны Пропуски
DeepSeek Точность ответа (оценка 4, вклад 1.20); Логичность и структура (оценка 5, вклад 1.00); Глубина и полнота ответа (оценка 5, вклад 1.00) Креативность (оценка 1, вклад 0.05); Гибкость в интерпретации (оценка 1, вклад 0.10); Чувствительность к контексту (оценка 4, вклад 0.20) 0
ChatGPT Точность ответа (оценка 4, вклад 1.20); Логичность и структура (оценка 3, вклад 0.60); Понимание технической специфики (оценка 4, вклад 0.40) Адекватность формата (оценка 2, вклад 0.10); Обработка сложных запросов (оценка 1, вклад 0.10); Контекстная согласованность (оценка 3, вклад 0.15) 0
Алиса AI Логичность и структура (оценка 5, вклад 1.00); Глубина и полнота ответа (оценка 3, вклад 0.60); Точность ответа (оценка 1, вклад 0.30) Контекстная согласованность (оценка 1, вклад 0.05); Гибкость в интерпретации (оценка 1, вклад 0.10); Чувствительность к контексту (оценка 2, вклад 0.10) 0

Почему победила модель

Победила DeepSeek с K=0.792.
Ближайший конкурент: ChatGPT (отрыв 0.217).
Критерий Лидер Конкурент Разрыв (вес)
Точность ответа 4 4 0.000
Логичность и структура 5 3 0.400
Глубина и полнота ответа 5 1 0.800
Гибкость в интерпретации 1 2 -0.100
Адекватность формата 5 2 0.150
Чувствительность к контексту 4 5 -0.050

Визуализация

Рейтинг по K
Весовая структура критериев
Профили лидеров
Вклад критериев лидера
Тепловая карта оценок

Анализ чувствительности

Пересчёт происходит автоматически при изменении ползунков.

Новый рейтинг при изменённых весах

Место Модель K
1 DeepSeek 0.792
2 ChatGPT 0.575
3 Алиса AI 0.433

Финальная сводка

Итоговый отчёт
Проект: Демо проект (резерв копия)
Сценарий: Логический сценарий

Рекомендуемая модель: DeepSeek
Интегральная оценка (K): 0.792
Интерпретация: Хорошая модель, подходит для большинства задач.

Почему именно эта модель:
- Ключевые критерии вклада: Точность ответа, Логичность и структура, Глубина и полнота ответа
- Отрыв от второго места: 0.217
- Выбор выглядит стабильным.
- Ближайший конкурент: ChatGPT
- Наибольшее преимущество по критериям: Глубина и полнота ответа, Логичность и структура, Обработка сложных запросов
- Где лидер уступает: Креативность, Гибкость в интерпретации, Понимание технической специфики
- Сильные стороны лидера: Точность ответа (оценка 4, вклад 1.20), Логичность и структура (оценка 5, вклад 1.00), Глубина и полнота ответа (оценка 5, вклад 1.00)
- Слабые стороны лидера: Креативность (оценка 1, вклад 0.05), Гибкость в интерпретации (оценка 1, вклад 0.10), Чувствительность к контексту (оценка 4, вклад 0.20)

Условия, при которых выбор может измениться:
- Если повысить веса критериев, где сильнее ChatGPT (Креативность, Гибкость в интерпретации, Понимание технической специфики), лидер может измениться.

Примечание: расчёт основан на включённых критериях и текущих весах.