ブラウザ操作の概要

Agentino では、API が用意されていないサービスでも実ブラウザを使って画面操作を自動化できます。 このページでは、ブラウザ操作の仕組みやログイン状態の保持、操作種別ごとの挙動について説明します。

どんなときに使うか

Agentino は、人が見る画面そのものを操作するブラウザを標準で備えています。 そのため、ログインが必要な Web サービスや API を持たない社内システムでも、取得や入力、登録を実行できます。

API があるツールは、MCP や HTTP API で接続するのが基本です。 ブラウザ操作は、API が無い場合や、API を使うよりも画面操作のほうが簡単な場合に使います。

ログインの永続化

ブラウザ操作では、ログイン状態を保存できます。 プロファイルと呼ばれる単位でログイン情報を保持し、次回以降はログインし直す必要がありません。

ログインは Web UI から完結します。 ログイン URL を発行して人がログインし、「完了して保存」を選ぶと、プロファイルに保存されます。

設定の手順はプロファイルの作成とログインを参照してください。

要素の特定

ブラウザ操作は、CSS セレクタで画面の要素を特定します。 要素の取得、入力、クリックを決定論的に行います。 要素の特定に AI は使いません。

これにより、画面構成が変わらない限り、同じ操作が安定して実行されます。

read 系と write 系

操作は read 系と write 系に分かれます。

  • read 系: 画面の情報の取得、ページの閲覧・移動
  • write 系: 入力、クリック、ファイル選択

read 系は承認なしで実行されます。 write 系は初期設定でツールごとの承認の対象です。

AOP での書き方

AOP の「使う道具」には browser と書きます。 保存済みのプロファイルを使う場合は、プロファイル名を添えます。

(使う道具: browser (profile: プロファイル名))

このセクションのページ

関連ページ

目次
ヘルプ・使い方