Демо проект (резерв копия)

Сравнение llm моделей в различных условиях

Моделей: 3 Критериев: 0 Лидер: н/д

Сценарии (промпты)

Выберите отдельный сценарий или общую сводку по всем сценариям.

Придумай песню про разработчика

Общая сводка по всем сценариям

Сценариев: 4 Моделей: 3 Критериев: 50 Лидер: DeepSeek

Рекомендована DeepSeek (K=0.704). Моделей: 3 · Критериев: 50.

Рейтинг моделей по всем сценариям

Место Модель K Взвешенная сумма Интерпретация Пропуски
1 DeepSeek 0.704 19.350 Приемлемая модель, требуется доработка. 0
2 Алиса AI 0.613 16.850 Приемлемая модель, требуется доработка. 0
3 ChatGPT 0.575 15.800 Слабая модель, нужна настройка или замена. 0

Метрики LLM по всем сценариям

Модель Accuracy Precision Recall F1-score BLEU ROUGE-L BERTScore Perplexity
ChatGPT 0.576 0.608 0.544 0.574 0.558 0.567 0.574 38.9
DeepSeek 0.676 0.720 0.632 0.673 0.648 0.662 0.672 30.9
Алиса AI 0.584 0.592 0.576 0.584 0.566 0.575 0.582 38.3

Общая аналитика

Рейтинг по K
Весовая структура критериев
Профили лидеров
Вклад критериев лидера
Тепловая карта оценок
ComparatorAI Модель: meta/Meta-Llama-3.1-8B-Instruct · Обновлено: 2026-05-28 22:07:13
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты. 

Лидером по итогам оценки стал модуль DeepSeek, набравший 19,35 баллов из 50 возможных. На втором месте расположилась модель Алиса AI с результатом 16,85 баллов, а на третьем месте оказался ChatGPT с результатом 15,8 баллов. 

Оценка моделей была проведена по пяти критериям: точность ответа, логичность и структура, глубина и полнота ответа, гибкость в интерпретации и обработка сложных запросов. 

По каждому критерию модуль DeepSeek демонстрирует наибольшую эффективность, что подтверждается оценками по метрикам точности, логичности и глубины ответа. 

Модель Алиса AI также показывает хорошие результаты, особенно по критериям точности и глубины ответа. Однако, она демонстрирует некоторые слабые стороны, такие как адекватность формата и чувствительность к контексту. 

Модель ChatGPT, наоборот, демонстрирует хорошие результаты по критериям логичности и структуры, но слабые результаты по критериям точности и глубины ответа. 

В ходе оценки также были выявлены некоторые риски и условия, при которых лидерство может быть изменено. Например, если модуль DeepSeek демонстрирует хорошие результаты по критериям гибкости в интерпретации и обработки сложных запросов, то его лидерство может быть оспорено. 

В заключение, модуль DeepSeek демонстрирует наибольшую эффективность и лидерство в ходе сравнения моделей LLM в различных условиях. Однако, необходимо продолжить наблюдение за моделями и их развитием, чтобы определить, какая модель будет наиболее эффективной в долгосрочной перспективе. 

Рекомендация: модуль DeepSeek является наиболее эффективной моделью в ходе сравнения моделей LLM в различных условиях. 

Причины выбора: модуль DeepSeek демонстрирует наибольшую эффективность по всем критериям и метрикам. 

Сильные стороны: модуль DeepSeek демонстрирует хорошие результаты по критериям точности, логичности и глубины ответа. 

Слабые стороны: модуль DeepSeek демонстрирует некоторые слабые стороны, такие как гибкость в интерпретации и обработка сложных запросов. 

Риски: модуль DeepSeek демонстрирует хорошие результаты по критериям гибкости в интерпретации и обработки сложных запросов, что может привести к оспариванию его лидерства. 

Условия смены лидера: модуль DeepSeek может потерять лидерство, если он демонстрирует хорошие результаты по критериям гибкости в интерпретации и обработки сложных запросов. 

Практические выводы для LLM: модуль DeepSeek демонстрирует наибольшую эффективность и лидерство в ходе сравнения моделей LLM в различных условиях. Однако, необходимо продолжить наблюдение за моделями и их развитием, чтобы определить, какая модель будет наиболее эффективной в долгосрочной перспективе.

Краткое резюме

Моделей: 3 Критериев: 0 Лидер: н/д

Добавьте модели и оценки, чтобы получить резюме.

Критерии сценария

Творческий сценарий

У этого сценария пока нет критериев. Добавьте свои или выберите пресет.

Добавить критерии

Список моделей

Название Описание
ChatGPT Модель от openai
DeepSeek Модель от одноименной DeepSeek
Алиса AI Модель от Яндекса

Добавить модель

Библиотека моделей

Название Описание
DeepSeek Модель от одноименной DeepSeek
Гигачат Модель от Сбера
Алиса AI Модель от Яндекса
Claude Opus Модель от Anthropic
ChatGPT Модель от openai

Ввод оценок

Сначала добавьте модели и критерии.

Импорт оценок из CSV

Формат: model, criterion, score

Рейтинг моделей

Нет данных для расчёта.

Метрики оценки LLM

Метрики появятся после ввода оценок.

Оценка по методике TOPSIS

TOPSIS появится после добавления моделей, критериев и оценок.

Вклад критериев

Критерий Вес Оценка Вклад

Сильные и слабые стороны

Модель Сильные стороны Слабые стороны Пропуски

Почему победила модель

Нет данных для определения лидера.

Визуализация

Добавьте модели, критерии и оценки, чтобы построить визуальные сравнения.

Анализ чувствительности

Добавьте хотя бы один критерий.

Новый рейтинг при изменённых весах

Нет данных для пересчёта чувствительности.

Финальная сводка

Недостаточно данных для формирования отчёта.