Manus против агентных режимов ChatGPT и Claude: 20 задач — Обзор Manus
🎁 +100% к первому пополнению в LeanTech AI — до конца акции --:--:-- Забрать бонус →
Manus — обзор ИИ-агента на русскомManus AI · автономный агент · задачи под ключ Войти Регистрация →

Manus против агентных режимов ChatGPT и Claude: 20 задач

Автор: Игорь Савельев2026-07-1114 мин

Сравнивать агентов по бенчмаркам бессмысленно: пользователю важно не число в таблице, а получил ли он готовый файл и сколько это стоило. Мы взяли 20 повторяющихся рабочих заданий — ресёрч, таблицы, слайды, лендинг, рутина — и прогнали их через Manus и агентные режимы двух больших чатов.

Коротко: что показал тест

  • Manus чаще остальных доводил задачу до артефакта без напоминаний — файл, таблица, запущенная страница.
  • Большие чаты быстрее и удобнее там, где нужен диалог, а не сдача результата.
  • Разница в качестве текста оказалась меньше, чем разница в дисциплине выполнения.
  • Стоимость одной завершённой задачи у агента выше на простых заданиях и ниже на длинных.
  • Проверять результат всё равно приходится: цифры и ссылки выборочно сверяли во всех случаях.

Почему бенчмарки тут бесполезны

Публичные тесты меряют качество ответа на изолированной задаче. Агент решает другую проблему: он должен пройти путь из десятка шагов и не потеряться на середине. Ошибка на третьем шаге обесценивает идеальную формулировку на десятом — и именно это чаще всего портит впечатление от агентов в реальной работе.

Поэтому мы мерили не «правильность», а долю задач, завершившихся пригодным результатом с первого запуска. Это грубая метрика, зато она совпадает с тем, ради чего инструмент покупают.

Методика: 20 задач и критерий приёмки

Как устроен один прогон тестаСхема: задание, запуск, приёмка по критерию, оценка.Как устроен один прогон тестаЗаданиеодинаковый текстЗапускдважды, разные дниПриёмкагоден без правок?Оценкабалл и расход
Каждое из 20 заданий проходило одинаковый путь. В зачёт шёл худший из двух запусков — так тест ближе к реальности, где повезти может не всегда.

Условия были одинаковыми для всех: тот же текст задания, те же исходные файлы, тот же критерий приёмки — результат должен быть пригоден к отправке коллеге без переписывания. Мелкие правки оформления не считались провалом, переписывание структуры — считалось.

Важная деталь: мы не помогали сервисам по ходу. Как только начинается диалог с уточнениями, сравнение превращается в тест того, кто лучше пишет промпты, а не в тест инструмента.

Блок 1. Ресёрч и отчёты

Четыре задания: обзор рынка, разбор конкурента, подборка источников за год, фактчек чужого текста. Здесь агент ведёт заметнее всего — он реально проходит по страницам, а не пересказывает то, что помнит модель.

Доля задач, доведённых до готового файла с первого запускаСтолбчатая диаграмма по блоку ресёрча.% задач, принятых с первого разаManusагентЧат Aагентный режимЧат Bагентный режим
Блок ресёрча: доля заданий, где результат был пригоден к отправке без переписывания. Обход источников — сильная сторона агента.

Главное практическое преимущество — ссылки в отчёте: их можно проверить, и на выборке они подтверждались. Слабое место общее для всех: материалы за последние недели попадают в выборку неравномерно, поэтому «самое свежее» стоит искать вручную.

Блок 2. Таблицы и данные

Четыре задания на разбор выгрузок: качество данных, сведение файлов по ключу, динамика по месяцам, короткий отчёт по цифрам. На чистых данных все трое считают корректно — разница проявилась на грязных.

Что проверялиManusЧат AЧат B
Сообщает о пропусках и дубляхДаИногдаИногда
Сохраняет исходные строкиДаДаЧастично
Приводит форматы дат к одному видуДаДаДа
Отдаёт файл, а не текстДаДаНет
Объясняет расчётКраткоПодробноПодробно

Вывод простой: чаты лучше объясняют, агент лучше сдаёт. Если результат нужен как файл для коллеги — выигрывает агент; если нужно понять логику расчёта — чат.

Блок 3. Презентации

Четыре задания: презентация по теме, питч продукта, конвертация документа в слайды, отчёт для руководства. Это сценарий, ради которого агентом чаще всего и начинают пользоваться.

Претензия у нас одна и та же ко всем участникам: оформление приходится приводить к фирменному стилю руками. Зато структура и тезисы приходят в пригодном виде, и это экономит основную часть времени — обычно час-полтора на десять слайдов.

Проверить это на своей презентацииАгентные сценарии и топовые модели на одном балансе: без VPN, оплата картой РФ через ЮKassa, +100% к первому пополнению.Открыть доступ к ИИ-агенту →

Блок 4. Лендинг и прототип

Четыре задания: одностраничник под оффер, прототип экрана со списком и фильтром, правки в готовой странице, страница с калькулятором. Все трое собирают одностраничник за один заход, но агент чаще доводит до запущенной страницы, а не до куска кода.

  • Для прототипа и внутренней демонстрации результата достаточно.
  • Для продакшена — нет: код требует ревью, доступности и оптимизации.
  • Правки в существующей странице проходят хуже, чем создание с нуля: сохранить чужие стили сложнее, чем написать свои.

Блок 5. Рутина в браузере

Четыре задания на сбор данных со страниц, проверку ссылок и мониторинг изменений. Здесь агент почти безальтернативен: чат может объяснить, как это сделать, но не сделает. Ограничение тоже понятное — страницы с защитой от автоматизации останавливают всех, и это не решается формулировкой задания.

Сводные баллы

БлокManusЧат AЧат BКомментарий
Ресёрч4.64.13.9Агент проходит по источникам
Данные4.34.34.0Паритет на чистых данных
Презентации4.54.24.0Файл против плана слайдов
Веб4.23.93.8Запущенная страница
Рутина4.42.82.6Чаты почти не участвуют
Итого4.43.93.7По нашей шкале приёмки

Цена одной завершённой задачи

Считать надо не подписку, а стоимость результата. То, что в чате занимает двадцать сообщений и полчаса вашего времени, у агента укладывается в один запуск — но запуск дороже одного сообщения.

Относительная стоимость одной завершённой задачиГоризонтальные полосы: короткая задача дороже у агента, длинная — дешевле.Относительная стоимость одной завершённой задачиКороткий вопросчат дешевлеСредняя задачапримерно равноДлинный ресёрчагент дешевлеРутина в браузереальтернативы нет
Чем длиннее цепочка шагов, тем выгоднее агент. На коротких задачах он проигрывает обычному чату почти всегда.

Когда агент, а когда обычный чат

Когда какой инструмент выгоднееДве колонки: задачи для чата и задачи для агента.Лучше обычный чатКороткий вопрос или советОбсуждение решенияПравка готового текстаБыстрый черновикЛучше агентРезультат = файлОбход десятков источниковПовторяющаяся рутинаДлинная цепочка шагов
Практическое правило: если задача заканчивается решением — берите чат, если файлом — агента.

Что нас удивило

  • Разброс между запусками оказался выше ожидаемого — на длинных задачах до 20% по нашей шкале.
  • Формулировка важнее модели. Одно и то же задание с заданным объёмом и языком поднимало результат сильнее, чем смена сервиса.
  • Ошибки чаще на входе, чем на выходе. Провалы возникали не в генерации, а в интерпретации исходных данных.

Как повторить тест у себя

  1. Возьмите пять реальных задач, которые повторяются у вас каждую неделю.
  2. Запишите текст задания один раз и не меняйте его между сервисами.
  3. Определите критерий приёмки заранее: что значит «годится».
  4. Запустите дважды с интервалом в день.
  5. Фиксируйте не только качество, но и время до результата и расход.

Готовые формулировки для такого теста есть в разделе навыки Manus, а разбор расходов — в материале про кредиты.

Частые вопросы

Какой сервис победил в тесте?

Однозначного победителя нет. Manus чаще доводил задачу до готового файла без напоминаний, большие чаты выигрывали в скорости и в диалоге. Если считать по критерию «результат можно отправить коллеге без переписывания», агент впереди в четырёх блоках из пяти.

Можно ли заменить агентом обычный чат?

Не стоит. Короткие вопросы и обсуждение решений в агенте обходятся дороже и медленнее. Разумная схема — держать оба инструмента и выбирать по типу задачи.

Насколько результаты воспроизводимы?

Каждое задание запускалось дважды, в оценку шёл худший результат. Разброс между запусками у всех сервисов заметный: на длинных задачах это 10–20% по нашей шкале.

Учитывалась ли цена?

Да, отдельным блоком. Мы считали не подписку, а стоимость одной завершённой задачи — включая переделки и уточнения.
app.leantech.aiМодели рядомСетка моделей LeanTech AI для сравнения на одинаковых задачах

Чтобы повторить наш тест, модели удобно держать в одном окне. открыть без VPN →

Перейти от чтения к задачеРегистрация 40 секунд без VPN и инвайтов, оплата картой РФ через ЮKassa, +100% к первому пополнению.Открыть доступ к ИИ-агенту →
LeanTech AI+100% к первому пополнению · без VPN, оплата картой РФ
Регистрация