Referanse for Windows 365 for Agents MCP-server

Merknad

Denne artikkelen beskriver funksjoner som brukes i agenter eller agentstrømmer drevet av standardledningsnettet.

Windows 365 for Agents er en MCP-server som gir deg full operasjonell kontroll over en Windows 365 sky-PC. Bruk denne MCP-serveren til å drive et ekte Windows-miljø gjennom skrivebordsinteraksjon (mus, tastatur, skjermopptak, kommandoutførelse), nettleserautomatisering via Microsoft Edge, og semantisk UI-inspeksjon via Windows UI-automatisering.

Merknad

Nettleserautomatisering fungerer på Microsoft Edge. Edge starter automatisk ved det første nettleserverktøykallet. focus_browser kan også rette seg mot Chrome eller Firefox, men DOM-nivå nettleserverktøy fungerer kun på Edge-instansen.

For å lære mer om Windows 365 for agenter, se Windows 365 for agentdokumentasjon.

Oversikt

Server-ID URL på leiernivå Visningsnavn Beskrivelse
mcp_W365ComputerUse https://agent365.svc.cloud.microsoft/
agents/tenants/{tenantId}/
servers/mcp_W365ComputerUse
Windows 365 for agenter MCP-server Full operasjonell kontroll over en Windows 365 sky-PC, inkludert skrivebordsinteraksjon, nettleserautomatisering og UI-inspeksjon.

Tilgjengelige verktøy

mcp_W365ComputerUse_StartSession

Starter en Windows 365-datamaskinbrukøkt, etablerer en tilkobling til en sky-PC og tildeler en sky-PC-ressurs. Returnerer sessionId, som kan brukes til å administrere økten.

Ingen påkrevde parametere.

mcp_W365ComputerUse_EndSession

Avslutter en aktiv Windows 365-datamaskinbrukøkt og frigjør de tilhørende sky-PC-ressursene. Send sessionId som returneres av mcp_W365ComputerUse_StartSession.

Påkrevde parametere: sessionId

mcp_W365ComputerUse_GetSessionDetails

Returnerer metadata for én Windows 365-datamaskinbrukøkt identifisert av sessionId. Send sessionId som returneres av mcp_W365ComputerUse_StartSession. Lister ikke opp flere økter.

Påkrevde parametere: sessionId

move_mouse

Flytter markøren til en skjermposisjon. Bruk click i stedet hvis du har tenkt å klikke på destinasjonen. Obligatoriske parametere:

  • x: X-koordinat i skjermpiksler
  • y: Y-koordinat i skjermpiksler

klikk

Klikk på en plassering, eller på gjeldende plassering av markøren hvis koordinater utelates. Støtter enkeltklikk, dobbeltklikk og alle fem museknappene.

Valgfrie parametere:

  • x: X-koordinat i skjermpiksler (utelat for nåværende posisjon)
  • y: Y-koordinat i skjermpiksler (utelat for nåværende posisjon)
  • Knapp: Venstre, Høyre, Midt, Fremover eller Bakover (standard Venstre)
  • clickCount: 1 = enkeltklikk, 2 = dobbeltklikk (standard 1)

get_cursor_position

Returnerer gjeldende markørkoordinater. Ingen parametere. Returnerer {cursorX, cursorY}.

dra_mus

Drar fra én posisjon til en annen. Nyttig for å flytte objekter, endre størrelse på vinduer eller bruke pikselpresis scrolling. Obligatoriske parametere:

  • startX: Start X-koordinat.
  • startY: Start Y-koordinat.
  • endX: End X-koordinat.
  • endY: End Y-koordinat. Valgfrie parametere:
  • knapp: Venstre, Høyre eller Midt (standard er Venstre)

scroll

Ruller i en posisjon ved hjelp av hakkenheter, ikke piksler. Tre hakk tilsvarer omtrent én side.

Obligatoriske parametere:

  • x: Rulleposisjon X
  • y: Rullposisjon Y

Valgfrie parametere:

  • deltaX: Horisontale hakk, positiv = høyre (standard 0)
  • deltaY: Vertikale hakk, positiv = ned (standard 0)

Merknad

Verdiene klemmes til området [-20, 20].

type_text

Skriver inn tekst ved å simulere tastaturinndata. For hurtigtaster, bruk press_keys. For webskjemafelt, bruk browser_type.

Obligatoriske parametere:

  • Tekst: Tekst til å skrive.

Valgfrie parametere:

  • usePaste: Lim inn tekst fra utklippstavlen i stedet for å skrive.

trykk_taster

Trykker på en tastekombinasjon samtidig. Støtter modifikatortaster, funksjonstaster og standardtaster.

Obligatoriske parametere:

  • Taster: Array av tastenavn som kan trykkes sammen (for eksempel, ["ctrl","c"], ["alt","tab"], ["ctrl","shift","s"])

ta_skjermbilde

Fanger opp hele skjermen eller et beskåret område som et PNG-bilde (base64-kodet).

Valgfrie parametere:

  • x: Avlingsregionens venstre kant
  • y: Avlingsregionens øvre kant
  • bredde: Bredde i avlingsområdet
  • høyde: Høyde i avlingsregionen

Merknad

Oppgi alle fire beskjæringsparametrene sammen, eller utelat alle fire for et fullskjermopptak.

zoom_område

Fanger et skjermområde i native oppløsning som et PNG-bilde (base64-kodet). Bruk denne funksjonen til å inspisere liten tekst eller tette UI-elementer som er vanskelige å lese i et nedskalert fullskjermskjermbilde.

Obligatoriske parametere:

  • x: Venstre kant X-koordinat i skjermpiksler
  • y: Y-koordinat på øverste kant i skjermpiksler
  • bredde: Regionbredde i piksler
  • høyde: Regionhøyde i piksler

Merknad

Maksimal regionsstørrelse er 1920x1080 piksler.

analyser_skjerm

Utfører OCR på hele skjermen. Ingen parametere. Returner {fullText, averageConfidence, boxes[{text, confidence, x, y, width, height}], width, height}.

get_screen_size

Returnerer skjermoppløsningen. Ingen parametere. Returner {width, height}.

list_windows

Lister opp alle synlige vinduer med titler, posisjoner og dimensjoner. Ingen parametere. Returnerer et array av {title, processName, handle, x, y, width, height}.

aktiver_vindu

Flytter et vindu til forgrunnen ved hjelp av et omtrentlig samsvar med tittelen.

Obligatoriske parametere:

  • title: Delvis vindustittel (skiftuavhengig understreng)

focus_browser

Fokuserer et nettleservindu (Edge, Chrome eller Firefox), eventuelt filtrert etter nettadresse eller tittel.

Valgfrie parametere:

  • mønster: URL eller tittel-understreng for å matche (utelates for nettleservinduer)

lukk_vindu

Lukker et vindu på en skånsom måte ved hjelp av omtrentlig samsvar i tittelen. Systemet beskytter kritiske prosesser, og du kan ikke lukke dem.

Obligatoriske parametere:

  • title: Delvis vindustittel (80 % samsvarsterskel). Returner {matchedTitle, processName, closed}.

endre_størrelse_på_vindu

Endrer størrelse på, flytter, maksimerer, minimerer eller gjenoppretter et vindu ved hjelp av et omtrentlig samsvar med tittelen.

Obligatoriske parametere:

  • tittel: Vindustittel som skal samsvare med (uten hensyn til store og små bokstaver, omtrentlig samsvar)
  • handling: handling å utføre - Resize, , Move, Maximize, Minimize, eller Restore

Valgfrie parametere:

  • x: Venstre kant X-koordinat (brukt med Resize eller Move)
  • y: Y-koordinat på øverste kant (brukt med Resize eller Move)
  • bredde: Bredde i piksler (brukt med Resize)
  • høyde: Høyde i piksler (brukt med Resize)

execute_shell_command

Kjører en shell-kommando i et sandkassemiljø. Kommandoen sjekkes mot en tillatelsesliste, og farlige mønstre blokkeres.

Obligatoriske parametere:

  • kommando: Kommando for å kjøre

Valgfrie parametere:

  • cwd: Arbeidskatalog. Bruk fremoverstrek (for eksempel C:/Users/me/project).
  • timeoutMs: Tidsavbrudd i millisekunder (standard 30 000, maks 120 000)

Merknad

  • Tillatte kommandoer: git, npm, dotnet, python, cargo, node, pip, dir, mkdir, del, copy, move, robocopy, findstr, where, type og notepad.
  • Blokkerte mønstre inkluderer skal-metakarakterer (|, ;, &, <, ), >utvidelse av miljøvariabler (%VAR%), tolkevalflagg (python -c eller node -e), git config --global, , npm -gkjørbare filer med stiprefiks, rm -rf, sudo, og disk- eller systemkommandoer.
  • Kommandoene stdout og stderr hver av dem forkortes ved 32 KB. For vilkårlig beregning, bruk execute_python_code. Kommandoen gir {stdout, stderr, exitCode, success, timedOut, resourceLimitsApplied}.

execute_python_code

Kjører Python-kode i et sandkassemiljø med ressursbegrensninger. Denne funksjonen er ideell for databehandling, beregninger, fil-I/O og enhver beregning som går utover enkle shell-kommandoer.

Obligatoriske parametere:

  • kode: Python kode (maks 262 144 tegn).

Valgfrie parametere:

  • cwd: Arbeidskatalog. Bruk fremoverkutt.
  • timeoutMs: Tidsavbrudd i millisekunder (standard 30 000, maks 120 000).

Returnerer samme skjema som execute_shell_command.

Merknad

Sandkassen håndhever en minnegrense på 512 MB og en 30 sekunders tidsavbrudd.

wait_milliseconds

Pauser kjøringen for å la animasjoner eller overganger fullføres. Ikke bruk denne funksjonen i polling-løkker. Bruk den heller browser_wait_for til DOM-polling.

Obligatoriske parametere:

  • ms: Ventetid i millisekunder (klemt til [0, 5000])

utklippstavle_les

Leser det nåværende innholdet på systemets utklippstavle. Denne kommandoen krever ingen parametere. Den returnerer et JSON-objekt som beskriver utklippstavleformatet og nyttelasten, som kan være enten en tekststreng eller et base64-kodet bilde.

utklippstavle_skriv

Skriver tekst til systemets utklippstavle, og erstatter det nåværende innholdet.

Obligatoriske parametere:

  • Tekst: Tekst for å skrive til utklippstavlen

Returnerer en bekreftelse som inkluderer antall tegn.

list_processes

Lister opp kjørende prosesser i den nåværende økten. Hver oppføring inkluderer PID, prosessnavn, minnebruk, vindustittel (hvis noen), og startTimeTicks. Kombiner startTimeTicks med kill_process for å unngå å ødelegge en resirkulert PID.

Valgfrie parametere:

  • maxCount: Maksimalt antall prosesser å returnere (standard 200)

Returnerer et JSON-array av prosessinformasjonsobjekter.

avslutt_prosess

Avslutter en prosess med PID. Gi startTime verdien for list_processes å beskytte mot PID-resirkulering.

Obligatoriske parametere:

  • pid: Prosess-ID returnert av list_processes
  • startTime: Prosessens starttid tikkes returnert av list_processes

Valgfrie parametere:

  • kraft: Kraft-drep uten elegant avstengning (standard falsk)

Returnerer et JSON-resultat som beskriver utfallet.

launch_application

Starter et GUI-program fra en tillatt katalog. Bruk execute_shell_command for CLI-kommandoer i stedet.

Obligatoriske parametere:

  • sti: Absolutt vei til den kjørbare filen. Bruk fremoverstrek (for eksempel C:/Program Files/app.exe).

Valgfrie parametere:

  • args: Array av kommandolinjeargumenter

Returner {path, pid}.

get_system_info

Returnerer OS-versjonen, CPU, RAM, tilgjengelig diskplass og skjermoppløsning. Ingen parametere. Returnerer et JSON-objekt som inneholder systeminformasjonen.

browser_navigate

Navigerer til en URL og venter på at siden skal lastes.

Obligatoriske parametere:

  • URL: Full URL inkludert protokoll (for eksempel, https://example.com)

browser_back

Navigerer tilbake i nettleserhistorikken. Ingen parametere.

browser_forward

Navigerer fremover i nettleserhistorikken. Ingen parametere.

browser_reload

Laster inn den nåværende siden på nytt. Ingen parametere.

browser_get_url

Returnerer den nåværende side-URL-en som en vanlig streng. Ingen parametere.

browser_get_title

Returnerer den nåværende sidetittelen som en vanlig streng. Ingen parametere.

browser_get_text

Returnerer det synlige sidetekstinnholdet som en vanlig streng. Ingen parametere. Avkortet til 512 KB.

browser_get_html

Returnerer helsides HTML-kildekode som en vanlig streng. Ingen parametere. Avkortet til 512 KB.

browser_get_page_state

Henter flere sidestatusfelt i ett enkelt kall. Nyttig for å fange opp flere signaler samtidig uten å sende separate verktøykall.

Obligatoriske parametere:

  • fields: Liste over felt som skal returneres. Tillatte verdier: url, title, , domscreenshot,tabs

Returnerer et JSON-objekt som kun inneholder de forespurte feltene.

nettleser_klikk

Klikker på et DOM-element med CSS-velger. Mer pålitelig enn koordinert klikk for nettinnhold.

Obligatoriske parametere:

  • selector: CSS-selector (for eksempel, #submit-btn eller a.nav-link)

browser_type

Skriver tekst inn i et skjemaelement ved å bruke en CSS-velger.

Obligatoriske parametere:

  • velger: CSS-velger av input-elementet.
  • Tekst: Tekst til å skrive.

browser_query_text

Henter tekstinnholdet til det første elementet som matcher en CSS-velger.

Obligatoriske parametere:

  • selektor: CSS-selektor.

browser_wait_for

Venter på at et DOM-element skal dukke opp. Denne funksjonen er nyttig for dynamisk innhold som lastes asynkront.

Obligatoriske parametere:

  • selector: CSS-selektor som det skal ventes på.

Valgfrie parametere:

  • timeoutMs: Timeout om millisekunder. Standard er 5 000 og maksimum er 30 000.

browser_eval_js

Evaluerer et JavaScript-uttrykk i sidekonteksten og returnerer resultatet som en streng.

Obligatoriske parametere:

  • uttrykk: JavaScript-uttrykk som returnerer en streng

Merknad

Hvis uttrykket ditt returnerer et objekt eller tall, konverter det eksplisitt til en streng (for eksempel, JSON.stringify(obj) eller .toString()).

nettleser_liste_faner

Lister alle åpne faner med indeks, tittel og URL. Ingen parametere kreves. Returnerer et array av {index, title, url}.

Valgfrie parametere:

  • tabId: Unik faneidentifikator

browser_switch_tab

Bytter til en fane via indeks.

Obligatoriske parametere:

  • tabIndex: 0-basert faneindeks

Valgfrie parametere:

  • tabId: Unik faneidentifikator

browser_new_tab

Åpner en ny fane, og navigerer eventuelt til en URL-adresse.

Valgfrie parametere:

  • URL: URL for å åpne (tom fane hvis utelatt)

Returner {index, title, url}.

browser_create_tabs

Åpner flere faner samtidig. Eventuelt ta en av dem frem i forgrunnen.

Obligatoriske parametere:

  • URL-er: Array av URL-er som skal åpnes, én fane per URL

Valgfrie parametere:

  • forgrunnIndeks: Indeks for fanen som bringes til forgrunnen etter opprettelse (utelat for å holde den nåværende fanen fokusert)

Returnerer en tekstbekreftelse.

lukk nettleserfane

Lukker en fane etter indeks.

Obligatoriske parametere:

  • tabIndex: 0-basert faneindeks. Valgfrie parametere:

  • tabId: Unik faneidentifikator

browser_screenshot

Fanger opp et PNG-skjermbilde av nettleservisningsporten (ikke hele skjermen). Ingen parametere. Returnerer en base64-kodet PNG.

browser_select_option

Velger ett eller flere alternativer i et <select> element etter value attributtet.

Obligatoriske parametere:

  • velger: CSS-velger for elementet <select>
  • verdier: Array av opsjonsverdi(er) å velge

Returnerer en bekreftelse med antall valgte alternativer.

browser_fill_form

Fyll ut flere skjemafelt i én samtale. Hver oppføring er et {selector, value} par. Operasjonen stopper ved første feil og rapporterer hvilke felt som lyktes.

Obligatoriske parametere:

  • felter: Matrise med {selector, value} par

Returnerer en bekreftelse med antall fylte felt.

browser_drag

Drar et kildeelement til et målelement. Begge elementene identifiseres med CSS-velger.

Obligatoriske parametere:

  • sourceSelector: CSS-velger for drag-kilden
  • targetSelector: CSS-velger for slippmålet

browser_pdf_save

Lagrer gjeldende side som en PDF-fil. Destinasjonsstier er begrenset til %USERPROFILE% eller %TEMP%.

Obligatoriske parametere:

  • filePath: Destinasjonsfilsti under %USERPROFILE% eller %TEMP%. Bruk fremoverkutt.

Returnerer en bekreftelse inkludert den lagrede filstien.

browser_handle_dialog

Godtar eller avviser en ventende nettleserdialogboks (varsel, bekreft, spør eller førinnlasting). Returnerer "Ingen dialog påvendig" hvis ingen dialog er aktiv.

Obligatoriske parametere:

  • Handling: accept eller dismiss

Valgfrie parametere:

  • promptText: Tekst for å sende til en prompt-dialog (ignorert for varsling og bekreft)

browser_get_cookies

Henter informasjonskapsler for gjeldende side, eller for et angitt sett med nettadresser. Informasjonskapselverdier redigeres alltid av sikkerhetsgrunner; Navn, domener, stier og flagg returneres.

Valgfrie parametere:

  • URL-er: Array av URL-er for å hente informasjonskapsler for (utelat for nåværende side)

Returnerer et array av cookie-objekter med redigerte verdier.

browser_set_cookies

Angir informasjonskapsler på gjeldende sidedomene. Denne handlingen legger til eller overskriver informasjonskapsler, men fjerner ikke eksisterende informasjonskapsler.

Obligatoriske parametere:

  • cookies: Array av cookie-objekter. Hver oppføring krever name og value. Valgfrie felt: domain, path, secure, httpOnly, . sameSite

Returnerer en tekstbekreftelse.

browser_execute_batch

Utfører flere nettleserhandlinger sekvensielt i én enkelt samtale. Denne handlingen stopper ved første feil og returnerer resultatene som er samlet inn til det punktet.

Obligatoriske parametere:

  • handlinger: Array av {action, params} objekter. Tillatte handlinger: navigate, snapshot, , click_reftype_ref, hover_ref, scroll_ref, keypress_ref, wait_for, , . eval_js

Returnerer et array av resultater, ett per utført handling.

browser_snapshot

Fanger opp sidens tilgjengelighetstre med stabile referanse-IDer (for eksempel e5) som mapper til DOM-noder. Bruk referansene med browser_click_ref, browser_type_ref, og browser_hover_ref. Referanser utløper når siden navigerer – ta et øyeblikksbilde på nytt etter navigasjon.

Valgfrie parametere:

  • maxDepth: Maksimal tredybde, 1-10 (standard 5)
  • includeIframes: Inkluder iframes fra andre opprinnelser (standardverdi: true)

Returnerer et JSON-objekt som inneholder tilgjengelighetssnapshot og ref-IDer.

browser_click_ref

Klikker på et element med referanse-ID fra browser_snapshot. En trefftest verifiserer at ingen andre elementer ligger over målet. Feiler hvis øyeblikksbildet utløper – ta øyeblikksbildet på nytt i så fall.

Obligatoriske parametere:

  • snapshotId: Snapshot-ID returnert av browser_snapshot
  • ref: Element ref (for eksempel, e5) fra snapshot-nodene

Valgfrie parametere:

  • knapp: Venstre, Høyre eller Midt (standard Venstre)
  • clickCount: 1 = enkeltklikk, 2 = dobbeltklikk (standard 1)

Gir en bekreftelse som inkluderer de klikkede koordinatene.

browser_type_ref

Skriver tekst inn i et element ved å bruke referanse-ID-en fra browser_snapshot. Elementet fokuseres først, og eksisterende tekst slettes som standard. Operasjonen mislykkes hvis øyeblikksbildet utløper.

Obligatoriske parametere:

  • snapshotId: Snapshot-ID returnert av browser_snapshot
  • ref: Element ref (for eksempel, e5) fra snapshot-nodene
  • Tekst: Tekst for å skrive

Valgfrie parametere:

  • klar: Rydd eksisterende tekst først (standard true)

Returnerer en bekreftelse som inkluderer antall tegn.

browser_hover_ref

Holder musepekeren over et element ved å bruke referanse-ID fra browser_snapshot. Returnerer umiddelbart. Operasjonen feiler hvis snapshotet utløper – ta snapshotet på nytt i så fall.

Obligatoriske parametere:

  • snapshotId: Snapshot-ID returnert av browser_snapshot
  • ref: Element ref (for eksempel, e5) fra snapshot-nodene

Returnerer en bekreftelse med hover-koordinatene.

get_accessibility_tree

Henter grensesnittelementtreet for forgrunnsvinduet. Hvert element inkluderer sin rolle, navn, verdi og skjermkoordinater.

Valgfrie parametere:

  • maxDepth: Maksimal dybde for traversering av treet, 1–10 (standardverdi 3)
  • maxElements: Maksimalt antall elementer å returnere, 1-2000 (standard 500)

Returnerer et hierarkisk tre med {rolle, navn, verdi, x, y, bredde, høyde, barn[...]}.

browser_keypress_ref

Trykker én enkelt tast på et element etter ref-ID fra browser_snapshot. Elementet fokuseres først. Støtter modifikatortaster. Feiler hvis snapshoten har utløpt — ta snapshoten på nytt i så fall.

Obligatoriske parametere:

  • snapshotId: Snapshot-ID returnert av browser_snapshot
  • ref: Element ref (for eksempel, e5) fra snapshot-nodene
  • nøkkel: Nøkkelnavn — for eksempel Enter, Escape, , Tab, ArrowUp, , ArrowDown, eller F1F12

Valgfrie parametere:

  • Modifikatorer: Array av modifikatortaster som holdes inne under trykket — Ctrl, , Shift, Alt, eller Meta

Returnerer en tekstbekreftelse.

browser_scroll_ref

Ruller et element til visning etter ref-ID fra browser_snapshot. Du kan også rulle etter et pikseldelta i elementet. Feiler hvis snapshoten utløper.

Obligatoriske parametere:

  • snapshotId: Snapshot-ID returnert av browser_snapshot
  • ref: Element ref (for eksempel, e5) fra snapshot-nodene

Valgfrie parametere:

  • deltaX: Horisontal scroll delta i piksler (standard 0)
  • deltaY: Vertikal rulle delta i piksler (standard 0)

Returnerer en tekstbekreftelse.

browser_set_file_input_ref

Angir filer på et filinndataelement etter ref-ID fra browser_snapshot. Filstier er begrenset til brukerens Documents, Downloads, Desktop, eller %TEMP% kataloger.

Obligatoriske parametere:

  • snapshotId: Snapshot-ID returnert av browser_snapshot
  • ref: Referanse til filinndatafeltet
  • filePaths: Liste over filstier som skal lastes opp

Returnerer en tekstbekreftelse.

find_ui_element

Søker etter grensesnittelementer etter tekstinnhold, tilgjengelighetsrolle eller navn (skille mellom store og små bokstaver). Returnerer matchende elementer med deres klikkbare skjermkoordinater.

Valgfrie parametere:

  • Tekst: Tekst å søke etter (brukes som navn hvis navn utelates)
  • rolle: Rollefilter for brukergrensesnitt - Button, TextBox, CheckBox, MenuItem, ComboBoxog mer
  • navn: Tilgjengelig navn (har forrang over tekst hvis begge er oppgitt)
  • windowHandle: Målvindushåndtak (null = forgrunnsvindu)

Nøkkelfunksjoner

Skrivebordssamhandling

  • Klikk, dobbeltklikk, høyreklikk og musekontroll med fem knapper.
  • Pikselpresis dra og slipp.
  • Hakkbasert rulling (tre hakk ≈ én side).
  • Tastaturtasting og kombinasjoner av flertaster og snarveier.
  • Sporing av markørposisjon.
  • Skjermoppløsningsdeteksjon.

Skjermopptak og analyse

  • Fullskjerm- eller beskårne PNG-skjermbilder.
  • OCR av fullskjerm med konfidenspoeng per region og avgrensningsbokser.
  • Skjermbilder kun i nettleservisning for webinnhold.

Vindusbehandling

  • List opp alle synlige vinduer med posisjoner og dimensjoner.
  • Aktiver vinduer ved fuzzy samsvar av titler.
  • Fokus-nettleservinduer (Edge, Chrome, Firefox) er valgfritt filtrert etter URL eller tittel.
  • Elegant vindulukking med beskyttelse for systemkritiske prosesser.

Kommandokjøring

  • Sandkassebaserte shell-kommandoer med en tillatelsesliste (git, npm, dotnet, python, cargo, node, pip, dir, mkdir, del, copy, move, robocopy, findstr, where, type).
  • Python-kjøring i sandkassemodus av opptil 262 144 tegn med kode.
  • Arbeidskatalog og timeout-kontroll per anrop (maks 30 sekunder).
  • Ressursgrenser og herdet blokkliste mot shell-metakarakterer, evalueringsflagg, privileger-eskalering og destruktive operasjoner.

Nettleserautomatisering

  • Naviger, tilbake, fremover, last inn på nytt, og konfigurerbare ventebetingelser på navigasjon (load, networkidle0, networkidle2).
  • Les sidens URL, tittel, synlig tekst (512 KB cap), og full HTML (512 KB cap).
  • Konsolidert sidestatushenting — URL, tittel, DOM, skjermbilde og faneliste i ett enkelt kall.
  • DOM-nivå klikk, type, skjemautfylling, dra og <select> valg av alternativer med CSS-velger.
  • Tilgjengelighetssnapshot-basert interaksjon via referanse-ID — klikk, skriv, hover, tastetrykk med modifikatorer, rulling og filinndata.
  • Vent på dynamiske elementer med konfigurerbar timeout, som eventuelt krever synlighet.
  • Vurder JavaScript uttrykk i sidekonteksten.
  • Multi-fanehåndtering: liste, bytt, åpne én eller flere samtidig, og lukk.
  • Cookie-inspeksjon (verdier redigert) og tilordnelse på det nåværende domenet.
  • Batched action execution — sekvenser flere nettlesersteg i ett kall, og stopper ved første feil.
  • Lagre den nåværende siden som PDF under %USERPROFILE% eller %TEMP%.
  • Dialoghåndtering for alert, confirm, prompt, og beforeunload.
  • Kjører på Microsoft Edge, starter automatisk ved første bruk.

Tilgjengelighet for brukergrensesnitt

  • Hente Windows UI-automatisering tree for forgrunnsvinduet med konfigurerbar dybde og antall elementer.
  • Finn UI-elementer etter tekst, rolle eller tilgjengelig navn.
  • Returnerer klikkbare skjermkoordinater for presis målretting av knapper, tekstbokser, avkrysningsbokser, menypunkter og kombinasjonsbokser.

Timing og synkronisering

  • Bruk wait_milliseconds til korte engangspauser (opptil fem sekunder).
  • Bruk browser_wait_for for polling på DOM-nivå (opptil 30 sekunder).

Notater

  • Alle koordinater er i skjermpiksler med (0,0) øverst til venstre. Koordinater fra take_screenshot, analyze_screen, , find_ui_elementog list_windows alle deler samme koordinatrom.
  • En markør failsafe er aktiv: Hvis markøren beveger seg innen fem piksler fra et hvilket som helst skjermhjørne, avbrytes museoperasjonene. Unngå å sikte på de ytterste kantene av skjermen.
  • Skjellpipeoperatorer (|), semikolon (;), ampersands (&) og utgangsomdirigering (>, <) blokkeres. For å transformere kommandoutdata, fang det opp og bearbeid det med execute_python_code.
  • Hvis tolkevalflagg blokkeres, eller hvis python -c "..." og node -e "..." avvises, kan du bruke execute_python_code for Python kode, eller skrive kode til en fil først.
  • Kommandoen stdout/stderr er avkortet til 32 KB hver. Bruk flagg for å begrense ordrik utdata (for eksempel git log --oneline -20) eller omdiriger til en fil og les den separat.
  • Maksimal timeout for execute_shell_command og execute_python_code er 30 sekunder. For lengre arbeid, del det opp i mindre steg eller start en bakgrunnsprosess fra Python og poll.
  • Det finnes ikke noe dedikert verktøy for fillesing/skriving. Les filer ved å execute_shell_command bruke kommandoen type . Skriv filer med execute_python_code ved å bruke Python innebygde fil-I/O. Omdirigering av shell-utdata (>, >>) er blokkert.
  • browser_eval_js Returnerer alltid en streng. Konverter objekter eller tall eksplisitt før du returnerer.
  • Nettleser-DOM-verktøy (browser_click, browser_type, browser_eval_js og andre) opererer kun på den Microsoft Edge instansen.  focus_browser kan fokusere på Chrome eller Firefox-vinduer, men DOM-verktøy retter seg ikke mot dem.
  • take_screenshot krever alle fire beskjæringsparametrene (x, y, bredde, høyde) sammen, eller ingen for fullskjermopptak.
  • scroll bruker notch-enheter (klemt til [-20, 20]), ikke piksler. Tre hakk er omtrent én side.
  • find_ui_element krever minst én av tekst, rolle eller navn. Når både tekst og navn oppgis, har navnet forrang.
  • browser_snapshot Referanser utløper ved navigasjon. Hvis et _ref verktøy (klikk, skriv, hover, tastetrykk, scroll eller sett filinntasting) feiler fordi snapshotet er utdatert, ta snapshotet på nytt og prøv på nytt.
  • browser_set_file_input_ref Godtar kun filstier under brukerens Documents, Downloads, , Desktopeller %TEMP% kataloger. Filer utenfor disse stedene blir avvist.
  • browser_get_cookies Returnerer alltid sensurerte informasjonskapselverdier. Bruk det til inspeksjon – navn, domener, stier og flagg returneres i sin helhet, men verdier vises ikke.
  • browser_set_cookies legger bare til eller overskriver informasjonskapsler. Den fjerner ikke eksisterende informasjonskapsler. For å fjerne en informasjonskapsel, overskriv den med en utløpt expires verdi via dette verktøyet, eller fjern den gjennom selve siden.
  • browser_execute_batch stopper ved første mislykkede handling og returnerer kun resultatene som er samlet inn til det punktet. Påfølgende handlinger i arrayet forsøkes ikke. Tillatte batchhandlinger er begrenset til: navigate, snapshot, , click_ref, type_ref, hover_refscroll_refkeypress_refwait_forog .eval_js
  • browser_create_tabs Åpner faner i den oppgitte rekkefølgen. Hvis foregroundIndex er utelatt, forblir fokuset på fanen for øyeblikket aktiv.
  • browser_get_page_state returnerer bare feltene som er oppført i arrayet fields . Be kun om det du trenger – inkludert dom eller screenshot kan produsere store laster.

Vanlige brukstilfeller

Fyll ut et nettbasert skjema

  • Ring browser_navigate for å åpne målsiden.
  • Ring browser_wait_for for å vente på at skjemaet skal lastes inn.
  • Kall browser_type for å fylle hvert felt med CSS-velger.
  • Ring browser_click for å sende inn skjemaet.
  • Ring browser_wait_for for å vente på bekreftelseselementet.
  • Ring browser_get_text for å lese og verifisere resultatet.

Automatiser en skrivebordsapplikasjon

  • Ring activate_window for å bringe applikasjonen i forgrunnen.
  • Ring take_screenshot for å fange den nåværende tilstanden.
  • Ring find_ui_element for å finne en knapp eller et felt med navn.
  • Kall click på elementets rapporterte koordinater.
  • Ring type_text for å legge inn data.
  • Ring press_keys om snarveier (for eksempel ["ctrl","s"] for å lagre).
  • Ring take_screenshot for å bekrefte resultatet.

Hent ut data fra en nettside

  • Ring browser_navigate for å åpne siden.
  • Ring browser_get_text for å hente ut synlig tekstinnhold.
  • Kall execute_python_code for å analysere og behandle de uttrukne dataene.
  • Kall browser_eval_js for å spørre spesifikke verdier via JavaScript når tekstuttrekking ikke er nok.

Kjør utviklingsoppgaver

  • Kall execute_shell_command for git pull, npm install, og dotnet build.
  • Ring take_screenshot for å fange byggeresultatet.
  • Ring execute_python_code for å analysere logger eller testresultater.
  • Ring browser_navigate for å åpne en lokal utviklerserver i nettleseren.
  • Kall browser_screenshot for å ta et bilde av den gjengitte siden.

Lese- og skrivefiler

  • Les en fil ved å bruke execute_shell_command med .type C:\path\to\file.txt
  • Skriv en fil ved å bruke execute_python_code med Python sine open(...) og write(...).
  • Bekreft ved å bruke execute_shell_command med dir C:\path\to\output.txt.
  • Ring get_accessibility_tree for å forstå hele UI-strukturen.
  • Kall find_ui_element for å finne en spesifikk kontroll (for eksempel role: "MenuItem", name: "Settings").
  • Ring click ved å bruke elementets rapporterte koordinater.
  • Ring find_ui_element igjen for å finne neste kontroll i dialogen.
  • Ring type_text eller click for å samhandle med den.

Hold en langvarig økt i live

  • Send en MCP-forespørsel minst én gang hvert 30. minutt for å forhindre utkastelse i tomgang uten pause.
  • get_screen_size Den er lett og fungerer godt som Heartbeat.

Mer informasjon

Windows 365 for Agenter