ブラウザ操作の概要
Agentino では、API が用意されていないサービスでも実ブラウザを使って画面操作を自動化できます。 このページでは、ブラウザ操作の仕組みやログイン状態の保持、操作種別ごとの挙動について説明します。
どんなときに使うか
Agentino は、人が見る画面そのものを操作するブラウザを標準で備えています。 そのため、ログインが必要な Web サービスや API を持たない社内システムでも、取得や入力、登録を実行できます。
API があるツールは、MCP や HTTP API で接続するのが基本です。 ブラウザ操作は、API が無い場合や、API を使うよりも画面操作のほうが簡単な場合に使います。
ログインの永続化
ブラウザ操作では、ログイン状態を保存できます。 プロファイルと呼ばれる単位でログイン情報を保持し、次回以降はログインし直す必要がありません。
ログインは Web UI から完結します。 ログイン URL を発行して人がログインし、「完了して保存」を選ぶと、プロファイルに保存されます。
設定の手順はプロファイルの作成とログインを参照してください。
要素の特定
ブラウザ操作は、CSS セレクタで画面の要素を特定します。 要素の取得、入力、クリックを決定論的に行います。 要素の特定に AI は使いません。
これにより、画面構成が変わらない限り、同じ操作が安定して実行されます。
read 系と write 系
操作は read 系と write 系に分かれます。
- read 系: 画面の情報の取得、ページの閲覧・移動
- write 系: 入力、クリック、ファイル選択
read 系は承認なしで実行されます。 write 系は初期設定でツールごとの承認の対象です。
AOP での書き方
AOP の「使う道具」には browser と書きます。
保存済みのプロファイルを使う場合は、プロファイル名を添えます。
(使う道具: browser (profile: プロファイル名))
このセクションのページ
- プロファイルの作成とログイン: プロファイルを作り、ログイン状態を保存します
- プロキシとブロックリスト: アクセス元の国と遮断するドメインを設定します
