Коротко
Что умеет ИИ-агент в браузере?
Обычный чат отвечает текстом. ИИ-агент в браузере делает работу руками: открыл кабинет, нашёл раздел, выгрузил отчёт, переложил цифры. Разница примерно как между консультантом по телефону и стажёром, который сел за твой компьютер.
На корпоративном обучении в конце сентября я показывал группе пример, где агент сам открывает систему электронного документооборота и заполняет документ. Это был самый живой момент дня. Реплика из зала - «Он сам открывает» - лучше любого слайда объясняет, почему эта функция цепляет.
Технически есть два способа работы:
- Встроенный браузер приложения. Чистый браузер внутри ChatGPT или Codex. Удобен для открытых сайтов и проверок, но в нём ты не вошёл в свои сервисы.
- Расширение в твоём браузере. Агент работает в твоих вкладках и твоём профиле, видит сайты, где ты уже вошёл: почту, CRM, кабинеты. По документации OpenAI расширение работает в Chrome, Edge, Brave, Opera и Vivaldi. Safari в этом списке нет, и на обучении этот вопрос как раз задавали.
Второй способ мощнее и рискованнее одновременно: агент получает доступ ко всему, куда вошёл ты.
Подходящие задачи и те, что лучше оставить себе
| Задача | Подходит агенту? | Почему |
|---|---|---|
| Собрать цены и условия с десяти сайтов в таблицу | да | только чтение, результат легко проверить |
| Проверить, что карточки товаров заполнены одинаково | да | однотипная проверка, человек смотрит итог |
| Выгрузить отчёт из кабинета без API | да, под присмотром | чтение в рабочей системе |
| Заполнить форму или документ по данным из таблицы | осторожно | нужна проверка перед отправкой |
| Обновить карточку клиента в CRM по заметкам встречи | осторожно | меняет рабочие данные |
| Оплатить счёт, оформить покупку | нет | необратимо, агенты такие действия блокируют |
| Удалить записи, создать аккаунт | нет | необратимо или запрещено политикой агента |
Правило, которое я советую на старте: агент читает сам, а пишет только после твоего «да». Что делать, если у площадки нет выгрузки и браузерный обход - единственный путь, подробно разбирал в материале о том, как забрать данные с сайта без API.
Где агент спотыкается?
Расскажу на своём примере.
Я поручил агенту проверить товарный знак для нового бренда по официальной базе Роспатента. Поиск он выполнил: нашёл сотни записей по нужным словам. А вот фильтры по классу и дате подачи не поддались. Поля там нестандартные, и попытка подставить значение напрямую положила «42» в поле даты: фильтр получил 1 января 2042 года.
Руками это закрывается минут за десять. Это хорошо показывает границу: агент отлично ходит, ищет и читает, но формы, сделанные «не как у всех», для него лотерея.
Ещё несколько типичных мест, где агент застревает:
- Капча и антибот-защита. Агенты не должны её обходить, и у Claude в Chrome это прямо в списке запрещённых действий.
- Длинные задачи. Чем больше шагов, тем выше шанс, что агент свернёт не туда на середине. Режь задачу на куски по пять-десять шагов.
- Разные интерфейсы у разных людей. У одного расширение встало, у другого нет. На обучении это видно сразу: у части группы всё работает, у части - нет.
- Отчёт вместо результата. Агент пишет «готово», а таблица заполнена наполовину. Как ловить такое, разбирал в материале про «готово» без результата.
Почему страница может командовать агентом?
Для чата это почти не проблема: он только отвечает. Для агента в браузере это главный риск, потому что он умеет действовать: переходить, заполнять, отправлять.
OpenAI в документации к расширению прямо пишет: относись к содержимому страниц, выделенному тексту и расшифровкам видео как к недоверенному контексту и проверяй страницу, прежде чем разрешать агенту действовать. У Anthropic в Claude в Chrome работают классификаторы, которые отлавливают такие атаки, а часть действий заблокирована полностью: покупки, создание аккаунтов, обход проверок на ботов, сделки, безвозвратное удаление файлов.
Заведи для агента отдельный профиль браузера и входи там только в сервисы, нужные для задачи. Тогда, даже если что-то пойдёт не так, агент не дотянется до личной почты, банка и всего остального, куда ты вошёл в основном профиле.
Про то, как вообще решать, давать ли агенту доступ к рабочей почте и серверу, подробно разбирал в отдельной статье про доступ агента к почте и серверу компании.
Какие разрешения давать и в каком порядке?
У ChatGPT по умолчанию агент спрашивает разрешение перед работой с каждым новым сайтом. Варианты ответа: разрешить один раз, разрешить для этого сайта, разрешить для всех сайтов или отказать. Есть списки разрешённых и запрещённых доменов. Доступ к истории браузера агент запрашивает отдельно, и постоянного разрешения на неё нет.
У Claude в Chrome похожая логика: агент составляет план, где перечислены сайты и шаги, ты его утверждаешь, и без нового разрешения агент от плана не отходит. Есть режим «спрашивать перед действием» и режим «действовать без вопросов».
Порядок, который я считаю безопасным:
- Первая неделя - подтверждение каждого нового сайта и каждого действия, которое что-то меняет.
- Знакомые рабочие сервисы - в список разрешённых.
- Банки, госуслуги, платёжные кабинеты - в список запрещённых сразу.
- Режим без вопросов - только для повторяющейся задачи на одном-двух сайтах, которую ты уже видел десяток раз.
Логика та же, что и с агентом на компьютере: сначала запреты, потом свобода. Что агент видит на диске и какие запреты ставить заранее, разбирал в материале о том, что агент делает на твоём компьютере.
Первая задача для агента в браузере
Чтение: таблица из открытых страниц
Например, условия доставки у десяти поставщиков или цены конкурентов. Проверь три строки руками: совпали ли цифры.
Заполнение с проверкой
Пусть агент заполнит форму или черновик документа по данным из таблицы и остановится перед кнопкой «Отправить». Смотришь, исправляешь, отправляешь сам.
Регулярная задача
То, что повторяется каждую неделю: выгрузка отчёта, сверка карточек. Её уже можно оформить как автозадачу, которая выполняется по расписанию.
Главное на этом этапе - не скорость, а понимание. После трёх задач ты будешь точно знать, где агент экономит час, а где проще сделать руками.
Частые вопросы
Частые вопросы
Главный вывод
Агент в браузере закрывает разрыв, о который спотыкаются почти все автоматизации: у нужной системы нет API, а руками перекладывать данные надоело. Но он работает в твоих сессиях, и поэтому правила доступа здесь важнее, чем в чате.
Практический шаг на эту неделю: заведи отдельный профиль браузера для агента и дай ему одну задачу на чтение - собрать в таблицу данные с пяти страниц, которые ты обычно открываешь руками.
Какую задачу в браузере ты бы отдал агенту первой?
Источники
- Browser extension - поддерживаемые браузеры, разрешения для сайтов и недоверенный контекст страниц, ChatGPT Learn
- Browser - встроенный браузер и Computer Use в ChatGPT и Codex, ChatGPT Learn
- Use Claude in Chrome safely - риски промпт-инъекций и меры защиты, Claude Help Center
- Claude in Chrome permissions guide - план, режимы разрешений и запрещённые действия, Claude Help Center
- LLM01: Prompt Injection - как ввод извне меняет поведение модели, OWASP GenAI Security Project
