Демо проект
Сравнение llm моделей в различных условиях
Сценарии (промпты)
Выберите отдельный сценарий или общую сводку по всем сценариям.
Общая сводка по всем сценариям
Рекомендована DeepSeek (K=0.691). Моделей: 3 · Критериев: 51.
Рейтинг моделей по всем сценариям
| Место | Модель | K | Взвешенная сумма | Интерпретация | Пропуски |
|---|---|---|---|---|---|
| 1 | DeepSeek | 0.691 | 19.350 | Приемлемая модель, требуется доработка. | 1 |
| 2 | Алиса AI | 0.602 | 16.850 | Приемлемая модель, требуется доработка. | 1 |
| 3 | ChatGPT | 0.564 | 15.800 | Слабая модель, нужна настройка или замена. | 1 |
Метрики LLM по всем сценариям
| Модель | Accuracy | Precision | Recall | F1-score | BLEU | ROUGE-L | BERTScore | Perplexity |
|---|---|---|---|---|---|---|---|---|
| ChatGPT | 0.576 | 0.608 | 0.544 | 0.574 | 0.558 | 0.567 | 0.574 | 38.9 |
| DeepSeek | 0.676 | 0.720 | 0.632 | 0.673 | 0.648 | 0.662 | 0.672 | 30.9 |
| Алиса AI | 0.584 | 0.592 | 0.576 | 0.584 | 0.566 | 0.575 | 0.582 | 38.3 |
Общая аналитика
В ходе сравнения моделей LLM в различных условиях выявлены следующие результаты. Лидером в данном проекте является модель DeepSeek, которая показала наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. Модель DeepSeek также показала наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры. Модель Алиса AI заняла второе место, показав хорошие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. Модель ChatGPT заняла третье место, показав средние результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. Однако, стоит отметить, что модель DeepSeek показала наибольший разрыв в лидерстве по критериям точности ответа и логичности и структуры. В целом, результаты показывают, что модель DeepSeek является наилучшим выбором для данного проекта, но также необходимо учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера. Рекомендуемая модель: DeepSeek. Причина выбора: Наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. Сильные стороны: Наилучшие результаты по метрикам точности, предсказательной силы, воспринимаемой полезности и F1-меры. Слабые стороны: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок. Риски: Низкие результаты по критериям контекстной согласованности, скорости ответа и эффективности исправления ошибок. Условия смены лидера: Если модель Алиса AI или ChatGPT покажут наилучшие результаты по критериям точности ответа, логичности и структуры, глубины и полноты ответа. Практические выводы для LLM: Нужно учитывать сильные и слабые стороны каждой модели, а также риски и условия смены лидера.
Краткое резюме
Добавьте модели и оценки, чтобы получить резюме.
Критерии сценария
Творческий сценарий
У этого сценария пока нет критериев. Добавьте свои или выберите пресет.
Добавить критерии
Список моделей
| Название | Описание | |
|---|---|---|
| ChatGPT | Модель от openai |
|
| DeepSeek | Модель от одноименной DeepSeek |
|
| Алиса AI | Модель от Яндекса |
|
Добавить модель
Библиотека моделей
| Название | Описание | |
|---|---|---|
| DeepSeek | Модель от одноименной DeepSeek |
|
| Гигачат | Модель от Сбера |
|
| Алиса AI | Модель от Яндекса |
|
| Claude Opus | Модель от Anthropic |
|
| ChatGPT | Модель от openai |
|
Ввод оценок
Сначала добавьте модели и критерии.
Импорт оценок из CSV
Формат: model, criterion, score
Рейтинг моделей
Нет данных для расчёта.
Метрики оценки LLM
Метрики появятся после ввода оценок.
Оценка по методике TOPSIS
TOPSIS появится после добавления моделей, критериев и оценок.
Вклад критериев
| Критерий | Вес | Оценка | Вклад |
|---|
Сильные и слабые стороны
| Модель | Сильные стороны | Слабые стороны | Пропуски |
|---|
Почему победила модель
Нет данных для определения лидера.
Визуализация
Добавьте модели, критерии и оценки, чтобы построить визуальные сравнения.
Анализ чувствительности
Добавьте хотя бы один критерий.
Новый рейтинг при изменённых весах
Нет данных для пересчёта чувствительности.
Финальная сводка
Недостаточно данных для формирования отчёта.