Сравнивать агентов по бенчмаркам бессмысленно: пользователю важно не число в таблице, а получил ли он готовый файл и сколько это стоило. Мы взяли 20 повторяющихся рабочих заданий — ресёрч, таблицы, слайды, лендинг, рутина — и прогнали их через Manus и агентные режимы двух больших чатов.
Коротко: что показал тест
- Manus чаще остальных доводил задачу до артефакта без напоминаний — файл, таблица, запущенная страница.
- Большие чаты быстрее и удобнее там, где нужен диалог, а не сдача результата.
- Разница в качестве текста оказалась меньше, чем разница в дисциплине выполнения.
- Стоимость одной завершённой задачи у агента выше на простых заданиях и ниже на длинных.
- Проверять результат всё равно приходится: цифры и ссылки выборочно сверяли во всех случаях.
Почему бенчмарки тут бесполезны
Публичные тесты меряют качество ответа на изолированной задаче. Агент решает другую проблему: он должен пройти путь из десятка шагов и не потеряться на середине. Ошибка на третьем шаге обесценивает идеальную формулировку на десятом — и именно это чаще всего портит впечатление от агентов в реальной работе.
Поэтому мы мерили не «правильность», а долю задач, завершившихся пригодным результатом с первого запуска. Это грубая метрика, зато она совпадает с тем, ради чего инструмент покупают.
Методика: 20 задач и критерий приёмки
Условия были одинаковыми для всех: тот же текст задания, те же исходные файлы, тот же критерий приёмки — результат должен быть пригоден к отправке коллеге без переписывания. Мелкие правки оформления не считались провалом, переписывание структуры — считалось.
Блок 1. Ресёрч и отчёты
Четыре задания: обзор рынка, разбор конкурента, подборка источников за год, фактчек чужого текста. Здесь агент ведёт заметнее всего — он реально проходит по страницам, а не пересказывает то, что помнит модель.
Главное практическое преимущество — ссылки в отчёте: их можно проверить, и на выборке они подтверждались. Слабое место общее для всех: материалы за последние недели попадают в выборку неравномерно, поэтому «самое свежее» стоит искать вручную.
Блок 2. Таблицы и данные
Четыре задания на разбор выгрузок: качество данных, сведение файлов по ключу, динамика по месяцам, короткий отчёт по цифрам. На чистых данных все трое считают корректно — разница проявилась на грязных.
| Что проверяли | Manus | Чат A | Чат B |
|---|---|---|---|
| Сообщает о пропусках и дублях | Да | Иногда | Иногда |
| Сохраняет исходные строки | Да | Да | Частично |
| Приводит форматы дат к одному виду | Да | Да | Да |
| Отдаёт файл, а не текст | Да | Да | Нет |
| Объясняет расчёт | Кратко | Подробно | Подробно |
Вывод простой: чаты лучше объясняют, агент лучше сдаёт. Если результат нужен как файл для коллеги — выигрывает агент; если нужно понять логику расчёта — чат.
Блок 3. Презентации
Четыре задания: презентация по теме, питч продукта, конвертация документа в слайды, отчёт для руководства. Это сценарий, ради которого агентом чаще всего и начинают пользоваться.
Претензия у нас одна и та же ко всем участникам: оформление приходится приводить к фирменному стилю руками. Зато структура и тезисы приходят в пригодном виде, и это экономит основную часть времени — обычно час-полтора на десять слайдов.
Блок 4. Лендинг и прототип
Четыре задания: одностраничник под оффер, прототип экрана со списком и фильтром, правки в готовой странице, страница с калькулятором. Все трое собирают одностраничник за один заход, но агент чаще доводит до запущенной страницы, а не до куска кода.
- Для прототипа и внутренней демонстрации результата достаточно.
- Для продакшена — нет: код требует ревью, доступности и оптимизации.
- Правки в существующей странице проходят хуже, чем создание с нуля: сохранить чужие стили сложнее, чем написать свои.
Блок 5. Рутина в браузере
Четыре задания на сбор данных со страниц, проверку ссылок и мониторинг изменений. Здесь агент почти безальтернативен: чат может объяснить, как это сделать, но не сделает. Ограничение тоже понятное — страницы с защитой от автоматизации останавливают всех, и это не решается формулировкой задания.
Сводные баллы
| Блок | Manus | Чат A | Чат B | Комментарий |
|---|---|---|---|---|
| Ресёрч | 4.6 | 4.1 | 3.9 | Агент проходит по источникам |
| Данные | 4.3 | 4.3 | 4.0 | Паритет на чистых данных |
| Презентации | 4.5 | 4.2 | 4.0 | Файл против плана слайдов |
| Веб | 4.2 | 3.9 | 3.8 | Запущенная страница |
| Рутина | 4.4 | 2.8 | 2.6 | Чаты почти не участвуют |
| Итого | 4.4 | 3.9 | 3.7 | По нашей шкале приёмки |
Цена одной завершённой задачи
Считать надо не подписку, а стоимость результата. То, что в чате занимает двадцать сообщений и полчаса вашего времени, у агента укладывается в один запуск — но запуск дороже одного сообщения.
Когда агент, а когда обычный чат
Что нас удивило
- Разброс между запусками оказался выше ожидаемого — на длинных задачах до 20% по нашей шкале.
- Формулировка важнее модели. Одно и то же задание с заданным объёмом и языком поднимало результат сильнее, чем смена сервиса.
- Ошибки чаще на входе, чем на выходе. Провалы возникали не в генерации, а в интерпретации исходных данных.
Как повторить тест у себя
- Возьмите пять реальных задач, которые повторяются у вас каждую неделю.
- Запишите текст задания один раз и не меняйте его между сервисами.
- Определите критерий приёмки заранее: что значит «годится».
- Запустите дважды с интервалом в день.
- Фиксируйте не только качество, но и время до результата и расход.
Готовые формулировки для такого теста есть в разделе навыки Manus, а разбор расходов — в материале про кредиты.
Частые вопросы
Какой сервис победил в тесте?
Можно ли заменить агентом обычный чат?
Насколько результаты воспроизводимы?
Учитывалась ли цена?

Чтобы повторить наш тест, модели удобно держать в одном окне. открыть без VPN →