# У площадки нет API: как всё равно забрать данные и не делать это руками

У большинства площадок нет программного доступа. Разбираю порядок из четырёх проверок, почему выгрузка файлом работает и когда оправдан обход страниц.

URL: https://posts.danashkin.ru/guides/u-sayta-net-api-kak-zabrat-dannye
Обновлено: 2026-09-02

---

## Коротко

**Главное**

- У большинства сайтов и баз, с которыми работает российский бизнес, нет программного доступа. Это не исключение, а нормальное состояние рынка.
- Порядок действий всегда один: проверить готовый способ подключения, потом выгрузку файлом, и только потом что-то сложнее.
- Выгрузка в файл выглядит примитивно и закрывает большую часть задач: агент прекрасно работает с таблицей, откуда бы она ни взялась.
- Автоматический обход страниц - последний вариант. Он медленный, ломается при смене вёрстки и требует смотреть на правила площадки.
- Правовая сторона важнее технической: публичность данных не означает разрешение на их сбор и повторную публикацию.

## Почему у площадки может не быть программного доступа

**Главное**

Потому что программный доступ нужно разрабатывать и поддерживать, а площадке это чаще всего невыгодно. Данные - её актив, и отдавать их удобным для машин способом она не обязана.

Ситуация, которую я вижу на обучениях у юристов, закупщиков и аналитиков почти дословно одинаково. Человек находит задачу, которая просится в автоматизацию: следить за торгами, собирать судебные акты, отслеживать позиции поставщиков. И упирается в стену.

Формулировка, которую я даю прямо: большинство ресурсов в интернете программного подключения не имеет, и рассчитывать на него по умолчанию не стоит.

Причины у площадки простые и не злонамеренные:

- **Данные - актив.** Отдавая их машинам, площадка теряет посещаемость и рекламу.
- **Поддержка стоит денег.** Программный доступ надо документировать, версионировать и держать живым.
- **Нагрузка.** Автоматические запросы идут потоком и стоят площадке ресурсов.
- **Ответственность.** За то, куда уедут данные, спросят с владельца сайта.

Вывод для планирования: если твоя идея держится на предположении «наверное, у них есть выгрузка», проверь это в первый же день. Отсутствие доступа меняет не срок, а сам замысел.

## Порядок из четырёх проверок

**Главное**

Проверяй по возрастанию сложности: готовое подключение, официальная выгрузка, ручная выгрузка, автоматический обход. Первый подходящий вариант и есть твой ответ, дальше идти не надо.

1. **Готовое подключение**

   Есть ли у сервиса собственный программный доступ или готовый разъём для нейросети. У крупных сервисов почти всегда есть, у площадок реже. Ищи в разделе для разработчиков или в описании интеграций.

2. **Официальная выгрузка**

   Кнопка «скачать таблицей» в личном кабинете. Скучно и надёжно: данные твои, формат стабильный, разрешение получать не надо.

3. **Ручная выгрузка по расписанию**

   Той же кнопкой, но раз в неделю или раз в день. Пять минут рутины взамен недель разработки. Часто это и есть правильный ответ.

4. **Автоматический обход страниц**

   Последний вариант. Медленно, хрупко и требует отдельного разговора о правилах площадки.

Про готовые разъёмы для нейросети и как они устроены, у меня есть отдельный разбор: [MCP простыми словами](/guides/mcp-prostymi-slovami). Если подключение есть, это самый короткий путь и заканчивать поиск можно на нём.

## Что такое выгрузка и почему это рабочий путь?

**Главное**

Это файл с данными в табличном виде, который сайт отдаёт по кнопке. Для агента он ничем не хуже прямого подключения: он читает таблицу, разбирает её и делает выводы. Разница только в том, что файл приносишь ты, а не программа.

Люди часто отвергают этот путь как несерьёзный. Мол, я же хотел автоматизацию, а получается ручной труд.

Разберём по существу. Автоматизация нужна не ради красоты, а ради экономии времени. Если задача состоит из выгрузки на минуту и разбора на два часа, то автоматизировав разбор, ты забрал 99 процентов выигрыша.

**Считай, что именно ты автоматизируешь**

Раздели задачу на «получить данные» и «сделать с ними работу». Обычно вся ценность во второй части. Первая часть в виде кнопки раз в неделю почти ничего не стоит и не ломается при смене вёрстки сайта.

Практический приём: заведи папку, куда складываешь выгрузки, и научи [агента](/concepts/ai-agent) работать с ней. Каждый новый файл он подхватывает сам, а тебе остаётся одно движение - положить его туда.

На обучениях я показываю этот приём на любых данных: выгрузка из системы учёта, отчёт из рекламного кабинета, таблица из банка. Механика одинаковая, потому что для агента это просто таблица.

## Браузерный обход: когда он оправдан

**Главное**

Когда данных нет ни в каком виде, кроме страниц, и задача действительно повторяется. Работает медленно, ломается при смене вёрстки и требует проверки правил площадки. Считать его основным способом не стоит.

Технически агент умеет открывать страницы и вытаскивать из них содержимое. Вопрос не в возможности, а в цене владения.

Что делает этот путь дорогим:

| Свойство | Что означает на практике |
|---|---|
| Скорость | страницы открываются по одной, сотня записей может занять минуты |
| Хрупкость | площадка поменяла вёрстку - сбор перестал работать |
| Ограничения | частые запросы упираются в лимиты и защиту от нагрузки |
| Поддержка | это не разовая настройка, а маленький продукт, который придётся чинить |

Разумный сценарий выглядит так: обход используется для узкой задачи с понятным списком страниц, а не как замена выгрузке. Например, раз в неделю проверить десяток конкретных карточек и записать изменения.

Отдельно скажу про уважение к площадке. Правила использования и файл с указаниями для роботов существуют не для галочки. Ломать защиту, обходить ограничения на доступ или маскировать автоматические запросы - это уже не автоматизация, а нарушение, и в бизнес-контуре так делать нельзя.

## Правовая рамка: что можно забирать

**Главное**

Общедоступность не равна разрешению. Смотреть надо на три вещи: правила использования площадки, охрану базы данных как объекта прав и наличие персональных данных внутри.

Это та часть, которую пропускают чаще всего, а она решающая для компании.

**Правила площадки.** Пользовательское соглашение может прямо запрещать автоматический сбор. Нарушение соглашения - основание для блокировки, а иногда и для претензии.

**Права на базу данных.** Существенная часть содержимого чужой базы охраняется отдельно от каждой конкретной записи. Скопировать разово для себя и построить на этом сервис - разные вещи с точки зрения права.

**Персональные данные.** Если в собранном есть фамилии, контакты, сведения о людях, включается отдельное регулирование, и общедоступность источника от обязанностей не освобождает.

Мой рабочий подход в таких проектах: до первой строки кода записать в файл проекта, откуда берутся данные, на каком основании и что с ними можно делать. Пять строк, которые потом отвечают на неприятные вопросы. Смежная тема - работа с чувствительными документами - разобрана в материале про [данные компании и нейросети](/guides/chuvstvitelnye-dannye-i-neyroseti-v-kompanii).

## Как поставить задачу агенту на работу с выгрузкой?

**Главное**

Описать источник, формат и результат. Агент не угадает, что означают ваши сокращения в шапке таблицы, зато прекрасно разберётся, если объяснить их один раз и записать объяснение в файл проекта.

Рабочая формулировка состоит из четырёх частей:

1. **Откуда данные.** «В папке выгрузки лежат файлы из системы торгов, новый появляется каждый понедельник».
2. **Что означают колонки.** Особенно те, где сокращения и внутренние коды. Один раз объяснил - записал в файл проекта.
3. **Что считать событием.** «Одна строка - один лот» или «одна строка - одно изменение статуса».
4. **Какой результат нужен.** Не «проанализируй», а «сделай список лотов, где цена упала больше чем на десять процентов с прошлой недели».

Отдельный совет для юридических и закупочных задач: начинай с одного типа документа или одной площадки. Универсальный сборщик всего - это проект на месяцы, а частная задача решается за вечер. Как выбирать первую задачу, разбирал через [фильтр «бесит, боюсь, спрашивают»](/guides/kakuyu-zadachu-otdat-ii-pervoy).

## Сколько это стоит по времени и что реально экономит

**Главное**

Разбор выгрузки настраивается за вечер и экономит часы каждую неделю. Автоматический обход страниц - это дни настройки плюс постоянная поддержка, и окупается он только на действительно регулярной задаче.

Честные ориентиры, которые я называю ученикам.

**Работа с выгрузкой:** один вечер на первую версию. Дальше каждый прогон - минуты. Ломается редко, потому что формат таблицы меняется реже, чем внешний вид сайта.

**Готовое подключение:** от часа до дня, если оно есть. Основное время уходит на получение доступов, а не на настройку.

**Автоматический обход:** от нескольких дней. И это не разовые расходы: любое изменение на площадке возвращает тебя к настройке.

Отсюда практическое правило. Если задача повторяется реже раза в неделю, обход почти никогда не окупается. Возьми выгрузку и пять минут рутины.

Про то, какие задачи в российском контуре вообще решаются доступными инструментами, есть смежный разбор про [российские нейросети для бизнеса](/guides/rossiyskie-neyroseti-dlya-biznesa).

## Частые вопросы

**Главное**

Что спрашивают чаще всего: можно ли просто дать агенту ссылку, что делать с сайтами без выгрузки, справится ли агент с распознаванием документов и законно ли собирать открытые данные.

### Частые вопросы

**Можно просто дать агенту ссылку на страницу?**

Для разовой задачи да: он откроет и разберёт содержимое. Для регулярной это не решение - каждый прогон будет требовать твоего участия.

**У площадки нет ни подключения, ни выгрузки. Что делать?**

Проверить, нет ли выгрузки в смежном сервисе или у агрегатора, который уже собрал те же данные. Это чаще срабатывает, чем кажется.

**Данные только в сканах документов. Это тупик?**

Нет. Распознавание текста из сканов работает хорошо, но результат обязательно проверяется: в юридических документах цена ошибки распознавания высокая.

**Собирать открытые данные законно?**

Зависит от правил площадки, от того, охраняется ли база, и от наличия персональных данных. Открытость источника сама по себе разрешения не даёт.

## Главный вывод

**Главное**

Отсутствие программного доступа не закрывает задачу, а меняет способ. Выгрузка файлом закрывает большинство сценариев за вечер, а автоматический обход страниц оправдан только на действительно регулярной работе и после проверки правил площадки.

Ошибка, которая стоит недель: начать проект с попытки построить сборщик данных и застрять в нём, не дойдя до самой работы.

Правильный порядок обратный. Возьми выгрузку за прошлый месяц, сделай на ней всю аналитическую часть, убедись, что результат нужен. Способ получать данные автоматически - последняя задача, а не первая.

Для юридических сценариев есть отдельный разбор с примерами задач: [нейросети для юристов](/guides/neyroseti-dlya-yuristov-rabochie-scenarii).

Открой ту площадку, ради которой всё затевалось. Есть ли у неё в личном кабинете кнопка выгрузки в таблицу?

### Источники

- [API - обзорная статья о программном интерфейсе, Википедия](https://en.wikipedia.org/wiki/Application_programming_interface)
- [Model Context Protocol - обзорная статья о протоколе подключения инструментов и данных, Википедия](https://en.wikipedia.org/wiki/Model_Context_Protocol)
- [Web scraping - обзорная статья об автоматическом сборе данных со страниц, Википедия](https://en.wikipedia.org/wiki/Web_scraping)
- [robots.txt - обзорная статья о файле с указаниями для автоматических обходчиков, Википедия](https://en.wikipedia.org/wiki/Robots.txt)
- [CSV - обзорная статья о табличном формате выгрузки, Википедия](https://ru.wikipedia.org/wiki/CSV)
- [Гражданский кодекс РФ, часть четвёртая - права на результаты интеллектуальной деятельности, включая базы данных](https://www.consultant.ru/document/cons_doc_LAW_64629/)
