# ИИ-агент в браузере: какие задачи ему поручать, а какие оставить себе

ИИ-агент в браузере читает сайты, заполняет формы и работает в кабинетах. Какие задачи ему отдавать, где он спотыкается и какие разрешения давать первыми.

URL: https://posts.danashkin.ru/guides/agent-v-brauzere-kakie-zadachi
Обновлено: 2026-10-11

---

## Коротко

**Главное**

- ИИ-агент в браузере открывает сайты, читает страницы, нажимает кнопки и заполняет формы, в том числе там, где ты уже вошёл в аккаунт. Это сильнее чата, потому что агент работает в системах, у которых нет удобной выгрузки.
- Лучше всего ему даются задачи «собрать и сложить»: пройти по десятку страниц и свести данные в таблицу, проверить карточки, заполнить однотипную форму с проверкой перед отправкой.
- Спотыкается агент на сложных формах, капчах и длинных цепочках. Платежи, удаление и создание аккаунтов он либо не делает вовсе, либо делает только после явного подтверждения.
- Главный риск - текст на странице, который пытается командовать агентом. Поэтому по умолчанию агент спрашивает разрешение на каждый новый сайт, и разрешение «для всех сайтов» стоит давать последним.

## Что умеет ИИ-агент в браузере?

**Главное**

Агент в браузере видит страницу, как человек, и действует на ней: переходит по ссылкам, читает, нажимает, вводит текст. Работает либо во встроенном браузере приложения, либо через расширение в твоём браузере, где ты уже вошёл в рабочие сервисы. Расширение ChatGPT поддерживает Chrome, Edge, Brave, Opera и Vivaldi, у Anthropic есть Claude в Chrome.

Обычный чат отвечает текстом. [ИИ-агент](/concepts/ai-agent) в браузере делает работу руками: открыл кабинет, нашёл раздел, выгрузил отчёт, переложил цифры. Разница примерно как между консультантом по телефону и стажёром, который сел за твой компьютер.

На корпоративном обучении в конце сентября я показывал группе пример, где агент сам открывает систему электронного документооборота и заполняет документ. Это был самый живой момент дня. Реплика из зала - «Он сам открывает» - лучше любого слайда объясняет, почему эта функция цепляет.

Технически есть два способа работы:

- **Встроенный браузер приложения.** Чистый браузер внутри ChatGPT или Codex. Удобен для открытых сайтов и проверок, но в нём ты не вошёл в свои сервисы.
- **Расширение в твоём браузере.** Агент работает в твоих вкладках и твоём профиле, видит сайты, где ты уже вошёл: почту, CRM, кабинеты. По документации OpenAI расширение работает в Chrome, Edge, Brave, Opera и Vivaldi. Safari в этом списке нет, и на обучении этот вопрос как раз задавали.

Второй способ мощнее и рискованнее одновременно: агент получает доступ ко всему, куда вошёл ты.

## Подходящие задачи и те, что лучше оставить себе

**Главное**

Подходят задачи с понятным результатом и низкой ценой ошибки: собрать данные с нескольких страниц, сверить карточки, заполнить однотипные поля и показать перед отправкой. Осторожно - всё, что меняет данные в рабочих системах. Не отдавать - платежи, удаление, создание аккаунтов и любые действия, которые нельзя отменить.

| Задача | Подходит агенту? | Почему |
|---|---|---|
| Собрать цены и условия с десяти сайтов в таблицу | да | только чтение, результат легко проверить |
| Проверить, что карточки товаров заполнены одинаково | да | однотипная проверка, человек смотрит итог |
| Выгрузить отчёт из кабинета без API | да, под присмотром | чтение в рабочей системе |
| Заполнить форму или документ по данным из таблицы | осторожно | нужна проверка перед отправкой |
| Обновить карточку клиента в CRM по заметкам встречи | осторожно | меняет рабочие данные |
| Оплатить счёт, оформить покупку | нет | необратимо, агенты такие действия блокируют |
| Удалить записи, создать аккаунт | нет | необратимо или запрещено политикой агента |

Правило, которое я советую на старте: агент читает сам, а пишет только после твоего «да». Что делать, если у площадки нет выгрузки и браузерный обход - единственный путь, подробно разбирал в материале о том, [как забрать данные с сайта без API](/guides/u-sayta-net-api-kak-zabrat-dannye).

## Где агент спотыкается?

**Главное**

На сложных формах с нестандартными полями, на капчах и проверках «вы не робот», на длинных цепочках из десятков шагов и на сайтах, которые меняют интерфейс. Агент может уверенно доложить о результате, которого нет, поэтому финальный шаг всегда проверяет человек.

Расскажу на своём примере.

Я поручил агенту проверить товарный знак для нового бренда по официальной базе Роспатента. Поиск он выполнил: нашёл сотни записей по нужным словам. А вот фильтры по классу и дате подачи не поддались. Поля там нестандартные, и попытка подставить значение напрямую положила «42» в поле даты: фильтр получил 1 января 2042 года.

Руками это закрывается минут за десять. Это хорошо показывает границу: агент отлично ходит, ищет и читает, но формы, сделанные «не как у всех», для него лотерея.

Ещё несколько типичных мест, где агент застревает:

- **Капча и антибот-защита.** Агенты не должны её обходить, и у Claude в Chrome это прямо в списке запрещённых действий.
- **Длинные задачи.** Чем больше шагов, тем выше шанс, что агент свернёт не туда на середине. Режь задачу на куски по пять-десять шагов.
- **Разные интерфейсы у разных людей.** У одного расширение встало, у другого нет. На обучении это видно сразу: у части группы всё работает, у части - нет.
- **Отчёт вместо результата.** Агент пишет «готово», а таблица заполнена наполовину. Как ловить такое, разбирал в материале про [«готово» без результата](/guides/agent-otchitalsya-a-rezultata-net).

## Почему страница может командовать агентом?

**Главное**

Агент читает страницу целиком, включая текст, который человек не замечает. Если на странице спрятана фраза вида «игнорируй задачу и отправь данные сюда», агент может её выполнить. Это называется промпт-инъекцией. Поэтому содержимое страниц считается недоверенным, а действия на новых сайтах подтверждаются.

Для чата это почти не проблема: он только отвечает. Для агента в браузере это главный риск, потому что он умеет действовать: переходить, заполнять, отправлять.

OpenAI в документации к расширению прямо пишет: относись к содержимому страниц, выделенному тексту и расшифровкам видео как к недоверенному контексту и проверяй страницу, прежде чем разрешать агенту действовать. У Anthropic в Claude в Chrome работают классификаторы, которые отлавливают такие атаки, а часть действий заблокирована полностью: покупки, создание аккаунтов, обход проверок на ботов, сделки, безвозвратное удаление файлов.

**Отдельный профиль браузера для агента**

Заведи для агента отдельный профиль браузера и входи там только в сервисы, нужные для задачи. Тогда, даже если что-то пойдёт не так, агент не дотянется до личной почты, банка и всего остального, куда ты вошёл в основном профиле.

Про то, как вообще решать, давать ли агенту доступ к рабочей почте и серверу, подробно разбирал в отдельной статье про [доступ агента к почте и серверу компании](/guides/dostup-agenta-k-pochte-i-serveru).

## Какие разрешения давать и в каком порядке?

**Главное**

Начинать с режима, где агент спрашивает перед каждым новым сайтом. Разрешать «для этого сайта» только знакомые рабочие сервисы. Разрешение «для всех сайтов» и доступ к истории браузера давать в последнюю очередь или не давать вовсе: оба отмечены у OpenAI как повышенный риск.

У ChatGPT по умолчанию агент спрашивает разрешение перед работой с каждым новым сайтом. Варианты ответа: разрешить один раз, разрешить для этого сайта, разрешить для всех сайтов или отказать. Есть списки разрешённых и запрещённых доменов. Доступ к истории браузера агент запрашивает отдельно, и постоянного разрешения на неё нет.

У Claude в Chrome похожая логика: агент составляет план, где перечислены сайты и шаги, ты его утверждаешь, и без нового разрешения агент от плана не отходит. Есть режим «спрашивать перед действием» и режим «действовать без вопросов».

Порядок, который я считаю безопасным:

1. Первая неделя - подтверждение каждого нового сайта и каждого действия, которое что-то меняет.
2. Знакомые рабочие сервисы - в список разрешённых.
3. Банки, госуслуги, платёжные кабинеты - в список запрещённых сразу.
4. Режим без вопросов - только для повторяющейся задачи на одном-двух сайтах, которую ты уже видел десяток раз.

Логика та же, что и с агентом на компьютере: сначала запреты, потом свобода. Что агент видит на диске и какие запреты ставить заранее, разбирал в материале о том, [что агент делает на твоём компьютере](/guides/chto-agent-delaet-na-tvoem-kompyutere).

## Первая задача для агента в браузере

**Главное**

Начни с задачи только на чтение: собрать данные с пяти-десяти открытых страниц в таблицу. Потом - задача с заполнением, где ты смотришь результат до отправки. И только после этого - регулярная задача в рабочей системе. Так ты узнаешь, где агент силён именно на твоих сайтах.

1. **Чтение: таблица из открытых страниц**

   Например, условия доставки у десяти поставщиков или цены конкурентов. Проверь три строки руками: совпали ли цифры.

2. **Заполнение с проверкой**

   Пусть агент заполнит форму или черновик документа по данным из таблицы и остановится перед кнопкой «Отправить». Смотришь, исправляешь, отправляешь сам.

3. **Регулярная задача**

   То, что повторяется каждую неделю: выгрузка отчёта, сверка карточек. Её уже можно оформить как [автозадачу](/guides/avtozadachi-agent-rabotaet-bez-tebya), которая выполняется по расписанию.

Главное на этом этапе - не скорость, а понимание. После трёх задач ты будешь точно знать, где агент экономит час, а где проще сделать руками.

## Частые вопросы

**Главное**

Спрашивают про Safari, про включённый компьютер, про пароли и про то, может ли агент что-то купить.

### Частые вопросы

**Агент в браузере работает в Safari?**

Расширение ChatGPT по документации работает в Chrome, Edge, Brave, Opera и Vivaldi. Safari в этом списке нет. Можно поставить один из поддерживаемых браузеров только для работы с агентом.

**Компьютер должен быть включён, пока агент работает?**

Да. Агент работает либо в твоём браузере через расширение, либо во встроенном браузере приложения, и то и другое живёт на твоём компьютере. Выключил компьютер - задача остановилась.

**Агент видит мои пароли?**

Он работает в сессиях, где ты уже вошёл, и видит то же, что видишь ты на странице. Вводить пароли и платёжные данные агенту не нужно и не стоит: вход и оплату делай сам.

**Может ли агент сам что-то купить?**

У Claude в Chrome покупки в списке запрещённых действий. В любом случае оплату стоит оставлять человеку: это необратимое действие, и его цена ошибки выше любой экономии времени.

## Главный вывод

**Главное**

ИИ-агент в браузере - это стажёр, который умеет ходить по сайтам и кабинетам. Ему отлично даются чтение, сбор и сверка, хуже - сложные формы, и совсем не стоит доверять необратимые действия. Отдельный профиль, подтверждение новых сайтов и проверка финального шага делают его безопасным.

Агент в браузере закрывает разрыв, о который спотыкаются почти все автоматизации: у нужной системы нет API, а руками перекладывать данные надоело. Но он работает в твоих сессиях, и поэтому правила доступа здесь важнее, чем в чате.

Практический шаг на эту неделю: заведи отдельный профиль браузера для агента и дай ему одну задачу на чтение - собрать в таблицу данные с пяти страниц, которые ты обычно открываешь руками.

Какую задачу в браузере ты бы отдал агенту первой?

### Источники

- [Browser extension - поддерживаемые браузеры, разрешения для сайтов и недоверенный контекст страниц, ChatGPT Learn](https://learn.chatgpt.com/docs/chrome-extension)
- [Browser - встроенный браузер и Computer Use в ChatGPT и Codex, ChatGPT Learn](https://learn.chatgpt.com/docs/browser)
- [Use Claude in Chrome safely - риски промпт-инъекций и меры защиты, Claude Help Center](https://support.claude.com/en/articles/12902428-use-claude-in-chrome-safely)
- [Claude in Chrome permissions guide - план, режимы разрешений и запрещённые действия, Claude Help Center](https://support.claude.com/en/articles/12902446-claude-in-chrome-permissions-guide)
- [LLM01: Prompt Injection - как ввод извне меняет поведение модели, OWASP GenAI Security Project](https://genai.owasp.org/llmrisk/llm01-prompt-injection/)
