Сравнение моделей на практике: A/B в чате GPThub
Сравнивать модели имеет смысл на вашей задаче, а не по чужим таблицам. В GPThub достаточно: один и тот же промпт, две модели вашего тарифа, заранее выбранные критерии. Ниже — как поставить мини-тест за 10–15 минут, когда хватит смены модели в чате и когда лучше открыть второй диалог, и как не обмануть себя «красивым» ответом.
Опубликовано 6 августа 2026 г.
Понадобится
- ·Доступ к хотя бы двум моделям (на бесплатном — Flash и Nano)
- ·Одна реальная задача: письмо, баг, саммари, ревью
Шаги
01Зафиксируйте задачу и критерии
Напишите в блокноте: что должно получиться и как поймёте, что ответ лучше. Примеры критериев: фактическая точность, полнота, тон, минимальность правок в коде, отсутствие выдуманных цифр. Без критериев вы выберете «что приятнее читать», а не что полезнее.
02Соберите один эталонный промпт
Одинаковый текст для обеих моделей: роль, цель, формат, ограничения, вставка. Не дописывайте второй модели «пояснения» — иначе сравниваете не модели, а промпты. Сохраните промпт в заметках или скопируйте из гайдов «Промпты для…».
03Выберите пару моделей честно
Сравнивайте сопоставимое: Flash vs GLM Flash, Luna vs Grok 4.3, Claude vs Terra — а не Nano против Claude на тяжёлой архитектуре. Обе модели должны быть доступны вашему тарифу. Картинка в задаче — обе с поддержкой изображений.
Совет: Подбор по задаче: гайды «модель для кода» и «для аналитики».
04Прогоните A, затем B
Вариант 1: новый чат на каждую модель с тем же промптом — чище, меньше влияния истории. Вариант 2: сменить модель в диалоге — быстрее, но предыдущие реплики могут подмешиваться. Для строгого A/B предпочтителен новый чат. Ответы сохраните рядом (A/B).
05Оцените по рубрике, не «на глаз целиком»
Пройдите критерии по одному: 1–5 или «да/нет». Для кода — запускаемость идеи патча; для текста — нет ли новых фактов; для аналитики — совпали ли цифры с входом. Можно третьим запросом (третья модель или та же) попросить сравнить два ответа по вашим критериям — но финальное слово за вами.
06Закрепите победителя под сценарий
Запишите: «письма → Claude/Grok», «быстрый баг → Flash», «скрины → Nano/Luna». Не ищите одну модель «навсегда». Повторяйте мини-тест, когда выходит новая модель в каталоге или меняется ваш основной сценарий.
Готовые запросы
Нажмите «Скопировать» и вставьте в чат. Текст в квадратных скобках замените на свой.
Карточка эксперимента
DeepSeek V4 FlashЗаполни карточку сравнения (не отвечай на задачу). Задача: [одно предложение] Критерии (3–5): […] Модель A: [имя] Модель B: [имя] Промпт (дословно): --- [вставьте] --- Формат карточки: задача, критерии, что считать успехом, что не сравниваем (скорость UI и т.п.).
Судья по двум ответам
Claude Sonnet 5Сравни ответ A и ответ B на одну задачу. Критерии (оценка 1–5 + комментарий в 1 строку): - точность / следование фактам - полнота - ясность - [ваш критерий] Итог: победитель или ничья + почему. Не переписывай ответы заново, только разбор. Задача: […] Ответ A: --- […] --- Ответ B: --- […] ---
Одинаковый рабочий промпт (шаблон)
любая пара моделейРоль: […] Цель: […] Формат ответа: […] Ограничения: […] Материал: --- […] --- Сначала выполни задачу. В конце — 2 пункта «что уточнить».
Готово, если…
- Есть 3–5 критериев до запуска
- Промпт идентичен для A и B
- Пара моделей сопоставима по классу и тарифу
- Учтены картинки (обе видят или обе нет)
- Оценка по рубрике, не только «красивый стиль»
- Победитель записан под сценарий, не «навсегда»
Частые ошибки
- Сравнивать по чужим бенчмаркам без своей задачи
- Дописывать второй модели подсказки «чтобы честно»
- Мерить только длину и «уверенность» тона
- Мешать историю диалога в строгом A/B
- Объявлять абсолютного победителя каталога по одному письму
Частые вопросы
Сколько прогонов нужно?
Для выбора «рабочей» модели на сценарий часто хватает 1–2 реальных задач. Для критичных процессов — 3–5 разных примеров, не один и тот же абзац.
Почему ответы «плывут» от раза к разу?
Генерация недетерминирована. Жёсткий формат и температура-по-сути (чёткие ограничения) уменьшают разброс. Сравнивайте при одинаковых промптах; при сомнении повторите.
Можно ли верить модели-судье?
Как черновику разбора — да. Как единственному судье — нет. Она может предпочесть «гладкий» текст. Ваши критерии и проверка фактов обязательны.
Что с тарифом: сравнивать Flash и Claude?
Можно для любопытства, но для решения «чем пользоваться каждый день» сравнивайте модели внутри доступного набора. Иначе победит «Про» почти всегда — и это не про пользу на бесплатном.
Где список моделей?
Каталог «Модели» и гайды по выбору под код и аналитику.
Связанные модели
DeepSeek V4 Flash
MoE 284B·13B активных · 1M контекст · скорость
GPT-5 Nano
GPT-5 Nano · картинки · ~400K контекст · бесплатно
Luna
GPT-5.6 Luna · картинки · ежедневные задачи · Плюс
Claude Sonnet 5
Sonnet 5 · картинки · 1M · агентный код · Про
Grok 4.5
Grok 4.5 · картинки · 500K · код и агенты · Про
Terra
GPT-5.6 Terra · картинки · ~1M контекст · Про
Источники
Попробовать в чате
Доступ из России без VPN. Начните с бесплатных моделей или выберите тариф.