AI-Agent (Playwright + OpenAI) Прототип автономного агента, который управляет браузером через Playwright и пытается выполнять многошаговые задания в веб-интерфейсах (например: «зайди в Яндекс.Почту, открой первое письмо, удали спам»). Проект запускает браузер, собирает видимые элементы страницы, просит модель спланировать действие (переход, клик, ввод, скролл, открытие первого элемента списка) и проверяет прогресс по изменению URL и содержимого.
Переменные окружения и запуск
Ключ OpenAI передаётся через переменную окружения OPENAI_API_KEY.
На Windows (PowerShell) это делается так:
$env:OPENAI_API_KEY = "sk-...ваш_ключ..."На macOS/Linux так:
export OPENAI_API_KEY="sk-...ваш_ключ..."Далее из корня проекта выполните:
go mod tidy
go run .Программа откроет браузер и предложит ввести задачу одной строкой.
Почему сейчас это не работает надёжно
Текущая модель GPT-4o не умеет стабильно соотносить визуальные элементы сложных SPA-интерфейсов с их реальным назначением без жёстко прописанных правил. Для типичных почтовых интерфейсов она путает рекламные баннеры с письмами, кликает по уже выбранной навигации и зацикливается, потому что не распознаёт, что состояние страницы не изменилось. Этой модели не хватает специализированного perception-модуля или дообучения на сценариях взаимодействия с UI: без этого универсальный планировщик «из коробки» не может автономно завершать подобные задачи. В результате агент выполняет базовые шаги (открыть сайт, перейти в раздел), но не гарантирует корректное открытие нужных писем и классификацию спама без хардкода селекторов под конкретный фронт.
Замечание по куки
По умолчанию используется persistent-контекст браузера, профиль Chromium с куки хранится на диске (путь задаётся в коде).