ChatGPT, Claude и Gemini: как сравнить под свою задачу
Сравниваем семейства ChatGPT, Claude и Gemini без фиктивного победителя: форматы документов, API, проверка ответов и практический тест для команды.

ChatGPT, Claude и Gemini стоит сравнивать на одинаковом рабочем наборе, а не по общему месту в рейтинге. Для документов проверьте сохранение смысла и привязку к источнику; для приложения: нужные API-операции, формат ответа, задержку и обработку ошибок.
Сравнивайте семейства, но выбирайте конкретную модель
Названия ChatGPT, Claude и Gemini часто используют как будто это три фиксированных инструмента. На практике за ними стоят разные приложения, API и меняющиеся наборы моделей. Даже внутри одного семейства варианты отличаются доступными модальностями, окном контекста и поддержкой отдельных функций. Поэтому итог эксперимента должен содержать точный ID, дату и способ доступа.
Если вы выбираете модель через Kvantora, начните с /models: там нужно подтвердить публичный API ID и операцию. Наличие семейства в этой статье не подтверждает наличие конкретной версии в каталоге. Для прямого подключения смотрите официальные страницы поставщиков, но не переносите их параметры в агрегированный API без проверки совместимости.
Редактура текста проверяется на ошибках смысла
Возьмите один плотный исходник, например описание возврата товара с тремя исключениями. Попросите сделать краткую инструкцию для поддержки. Сравнивайте не красоту фраз, а сохранение сроков, условий и исключений. Затем дайте противоречивый абзац и посмотрите, сообщает ли модель о конфликте или гладко подменяет его предположением.
Для Claude полезно проверить работу с цитированием исходных документов: официальный API описывает привязку фрагментов к ответу. Но цитата сама по себе не делает вывод верным. Для семейства OpenAI официальная документация показывает структурированные ответы; при переносе в другой сервис надо отдельно выяснить, поддерживается ли нужный режим. Не выдавайте общую способность семейства за гарантию каждой версии.
На документах важна природа входа
Один PDF может быть обычным текстом, другой представляет собой скан с таблицей и рукописной пометкой. Gemini API документирует обработку PDF с учётом визуальных элементов. Это даёт повод включить такой формат в тест, но не повод считать любое извлечение безошибочным. В проверочном наборе сделайте документ с таблицей, пустой графой и примечанием мелким шрифтом.
Если ваши файлы велики, оцените, помещаются ли они в контекст выбранной модели и насколько дорого повторять передачу. Длинное окно упрощает постановку некоторых задач, но может ухудшить экономику и не снимает потребность в точной проверке фактов. Иногда поиск по небольшим фрагментам с указанием источника оказывается удобнее, чем отправка архива целиком.
Слепое сравнение снижает эффект бренда
Если есть время, уберите названия моделей из нескольких результатов и дайте проверяющему только исходник, ответ и критерии. Это помогает отделить знакомую репутацию семейства от качества конкретной версии на вашем тексте. Для технических полей слепой режим не нужен: парсер и арифметика дадут точный результат. А вот редакторская оценка легко меняется, когда на обложке написано любимое имя.
Не устраивайте голосование за «самый умный» ответ. Пусть участник укажет конкретный фрагмент, который сохранил смысл или, наоборот, исказил условие. Так появляются примеры для будущей регрессии. Если один кандидат побеждает только на эссе, а другой на таблицах, это основание разделить маршруты по задачам, а не объявлять общего победителя для всех отделов.
API-сравнение идёт отдельно от диалога в браузере
Разработчику мало оценить сами ответы модели. Проверьте, какие endpoints доступны, как задаются инструменты, поддерживается ли нужный формат JSON, какие события приходят в потоке и что означает ошибка. Приложения ChatGPT, Claude и Gemini могут иметь функции, которых нет в API, и наоборот. Оценка по интерфейсу чата не заменяет испытание интеграции.
Сделайте короткий стендовый прогон: один обычный запрос, один с длинным входом, один с ожидаемым отказом по формату и один с разорванным соединением. Для каждого запишите фактический результат и поведение вашего клиента. Если новый маршрут меняет семантику повтора или статус незавершённого запроса, это влияет на деньги и корректность, даже когда текст ответа лучше.
Матрица выбора занимает одну страницу
Сформулируйте обязательные признаки и желательные. Обязательные могут включать разрешённую передачу документов, нужную модальность, валидируемый формат ответа и бюджет на полный сценарий. Желательные: стиль формулировок и скорость первого токена. Не компенсируйте провал обязательного признака красивым результатом на простом примере.
Сохраните отдельно мнения проверяющих и машинные проверки. Машина может точно проверить, что JSON парсится и сумма в счёте арифметически верна; редактор оценивает ясность письма. Если оценки расходятся, это полезная находка о задаче, а не шум для усреднения. Отметьте и случаи, когда правильный ответ звучит «данных недостаточно».
Выбор может быть не один
Небольшой команде иногда хватает одной модели для всех задач. Иногда разумнее иметь отдельный маршрут для документов и другой для быстрых черновиков. Такой выбор не требует большого оркестратора: зафиксируйте правила, по которым приложение выбирает разрешённый API ID, и держите тесты для каждого маршрута. Сложный автоматический переход при ошибке требует отдельной проработки, особенно если исход первого запроса неизвестен.
Перепроверяйте вывод после изменения модели, подсказки или формы входных документов. Официальные возможности семейства подсказывают, кого включить в список кандидатов; решение даёт только ваш повторяемый тест. На странице /models проверяйте доступность непосредственно перед интеграцией, а не по скриншоту чужого сравнения.






