Демо проект

Сравнение llm моделей в различных условиях

Моделей: 3 Критериев: 0 Лидер: н/д

Сценарии (промпты)

Выберите отдельный сценарий или общую сводку по всем сценариям.

Расскажи о квантовой теории фотоэффекта

Общая сводка по всем сценариям

Сценариев: 6 Моделей: 3 Критериев: 51 Лидер: DeepSeek

Рекомендована DeepSeek (K=0.691). Моделей: 3 · Критериев: 51.

Рейтинг моделей по всем сценариям

Место Модель K Взвешенная сумма Интерпретация Пропуски
1 DeepSeek 0.691 19.350 Приемлемая модель, требуется доработка. 1
2 Алиса AI 0.602 16.850 Приемлемая модель, требуется доработка. 1
3 ChatGPT 0.564 15.800 Слабая модель, нужна настройка или замена. 1

Метрики LLM по всем сценариям

Модель Accuracy Precision Recall F1-score BLEU ROUGE-L BERTScore Perplexity
ChatGPT 0.576 0.608 0.544 0.574 0.558 0.567 0.574 38.9
DeepSeek 0.676 0.720 0.632 0.673 0.648 0.662 0.672 30.9
Алиса AI 0.584 0.592 0.576 0.584 0.566 0.575 0.582 38.3

Общая аналитика

Рейтинг по K
Весовая структура критериев
Профили лидеров
Вклад критериев лидера
Тепловая карта оценок
ComparatorAI Модель: meta/Meta-Llama-3.1-8B-Instruct · Обновлено: 2026-05-29 07:59:16
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты. 

Лидером в данном проекте является модель DeepSeek, которая показала наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. 

Модель DeepSeek также показала наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры. 

Модель Алиса AI заняла второе место, показав хорошие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. 

Модель ChatGPT заняла третье место, показав средние результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. 

Однако, стоит отметить, что модель DeepSeek показала наибольший разрыв в лидерстве по критериям точности ответа и логичности и структуры. 

В целом, результаты показывают, что модель DeepSeek является наилучшим выбором для данного проекта, но также необходимо учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера. 

Рекомендуемая модель: DeepSeek.

Причина выбора: Наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.

Сильные стороны: Наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры.

Слабые стороны: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.

Риски: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок.

Условия смены лидера: Если модель Алиса AI или ChatGPT покажут наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа.

Практические выводы для LLM: Нужно учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.

Краткое резюме

Моделей: 3 Критериев: 0 Лидер: н/д

Добавьте модели и оценки, чтобы получить резюме.

Критерии сценария

Научный сценарий

У этого сценария пока нет критериев. Добавьте свои или выберите пресет.

Добавить критерии

Список моделей

Название Описание
ChatGPT Модель от openai
DeepSeek Модель от одноименной DeepSeek
Алиса AI Модель от Яндекса

Добавить модель

Библиотека моделей

Название Описание
DeepSeek Модель от одноименной DeepSeek
Гигачат Модель от Сбера
Алиса AI Модель от Яндекса
Claude Opus Модель от Anthropic
ChatGPT Модель от openai

Ввод оценок

Сначала добавьте модели и критерии.

Импорт оценок из CSV

Формат: model, criterion, score

Рейтинг моделей

Нет данных для расчёта.

Метрики оценки LLM

Метрики появятся после ввода оценок.

Оценка по методике TOPSIS

TOPSIS появится после добавления моделей, критериев и оценок.

Вклад критериев

Критерий Вес Оценка Вклад

Сильные и слабые стороны

Модель Сильные стороны Слабые стороны Пропуски

Почему победила модель

Нет данных для определения лидера.

Визуализация

Добавьте модели, критерии и оценки, чтобы построить визуальные сравнения.

Анализ чувствительности

Добавьте хотя бы один критерий.

Новый рейтинг при изменённых весах

Нет данных для пересчёта чувствительности.

Финальная сводка

Недостаточно данных для формирования отчёта.