Agenckie wyszukiwanie w Wyszukiwanie AI platformy Azure

Uwaga

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.

Important

Funkcje, możliwości lub właściwości oznaczone (wersja zapoznawcza) nie są objęte umową dotyczącą poziomu usług, nie są zalecane w przypadku obciążeń produkcyjnych i mogą ulec zmianie lub ograniczeniu, zanim staną się one ogólnie dostępne. Warunki Wyszukiwanie AI platformy Azure wersji zapoznawczej mają zastosowanie do wszystkich funkcji w wersji zapoznawczej, niezależnie od tego, czy jest ona autonomiczna, czy częścią ogólnie dostępnej funkcji.

W Wyszukiwanie AI platformy Azure agentowe pobieranie to proces z wieloma zapytaniami zaprojektowany dla złożonych pytań zadawanych przez użytkowników lub agentów w aplikacjach czatu i Copilot. Jest ona przeznaczona do pobierania wzorców rozszerzonej generacji (RAG) i przepływów pracy agenta do agenta.

Oto, na czym polega wyszukiwanie agentowe:

  • Można użyć planowania zapytań opartego na modelach LLM (wersja zapoznawcza), aby podzielić złożone zapytanie na mniejsze, bardziej precyzyjne podzapytania w celu lepszego pokrycia treści własnych i zewnętrznych. Planowanie zapytań może wykorzystywać historię czatu jako dodatkowy kontekst.

  • Uruchamia podzapytania równolegle. Każde podzapytanie jest semantycznie przebudowane, aby zwiększyć poziom najbardziej odpowiednich dopasowań.

  • Łączy najlepsze wyniki w jedną spójną odpowiedź, której model LLM może użyć do wygenerowania odpowiedzi opartych na źródłach.

  • Może zwracać odwołania do źródeł i dziennik aktywności wraz z połączoną zawartością, dzięki czemu można wykorzystać wyłącznie dane źródłowe lub przekazać je do LLM, aby uzyskać pełną odpowiedź.

Ten wysokowydajny proces pomaga generować wysokiej jakości dane ugruntowujące lub odpowiedzi dla aplikacji czatowej, umożliwiając szybkie udzielanie odpowiedzi na złożone pytania.

Dlaczego warto używać wyszukiwania agentowego?

Wyszukiwanie agentowe obsługuje zarówno rozwiązania zarządzane, jak i niestandardowe dla agentów i aplikacji. W portalu Microsoft Foundry zasila ona funkcję Foundry IQ jako zarządzaną warstwę wiedzy dla agentów. Można również tworzyć niestandardowe rozwiązania agentowego wyszukiwania przy użyciu portalu Azure, interfejsu API REST usługi Search lub obsługiwanego zestawu Azure SDK.

Użyj wyszukiwania agentowego, jeśli chcesz zapewnić agentom i aplikacjom najbardziej trafne treści do udzielania odpowiedzi na trudniejsze pytania, korzystając z kontekstu czatu, zasobów własnych i źródeł zewnętrznych.

Wyszukiwanie agentowe zwiększa opóźnienie w porównaniu z potokiem opartym na pojedynczym zapytaniu, ale radzi sobie ze złożonością zapytań, której pojedyncze zapytanie nie jest w stanie obsłużyć. Może na przykład obsługiwać następujące elementy:

  • Pytania zawierające wiele próśb, takie jak „znajdź mi hotel w pobliżu plaży, z transferem z lotniska i w odległości krótkiego spaceru od restauracji wegetariańskich.”

  • Pytania, które zależą od wcześniejszego kontekstu w konwersacji.

  • Zapytania, które zyskują na przeformułowaniu, z wykorzystaniem map synonimów i parafrazowania generowanego przez LLM w celu zwiększenia pokrycia w całej treści.

  • Błędy ortograficzne.

Diagram skomplikowanego zapytania pokazujący, jak agentowe odzyskiwanie obsługuje kontekst domniemany i celowe literówki.

Architektura i przepływ pracy

Proces pozyskiwania poprzez agencję działa w następujący sposób:

  1. Inicjowanie przepływu pracy: Aplikacja wywołuje bazę wiedzy z akcją pobierania, która udostępnia historię zapytań i konwersacji.

  2. Planowanie zapytań: Przy poziomach wysiłku rozumowania podczas wyszukiwania low i medium baza wiedzy wysyła Twoje zapytanie oraz historię rozmowy do modelu LLM, który generuje ukierunkowane podzapytania. Przy minimal nakładzie pracy ten krok jest pomijany, a zapytania są kierowane bezpośrednio do źródeł wiedzy. Nakład wnioskowania domyślnie ma wartość low i jest konfigurowany w bazie wiedzy.

  3. Wykonywanie zapytania: Baza wiedzy wysyła podzapytania do źródeł wiedzy. Wszystkie podzapytania są uruchamiane jednocześnie i mogą być słowami kluczowymi, wektorami lub wyszukiwaniem hybrydowym. Każde podzapytanie przechodzi proces semantycznego ponownego rankingowania w celu znalezienia najbardziej odpowiednich dopasowań. Referencje są wyodrębniane i przechowywane do celów cytowania.

  4. Synteza wyników: System łączy wszystkie wyniki w ujednoliconą odpowiedź. Połączona zawartość zawsze jest zwracana. Referencje źródłowe i dziennik aktywności wykonania są opcjonalne.

Diagram przepływu pracy pobierania agentów przy użyciu przykładowego zapytania.

Components

We wszystkich scenariuszach agentowego wyszukiwania wymagana jest baza wiedzy i co najmniej jedno źródło wiedzy. Inne składniki są opcjonalne i zależą od konfiguracji.

Składnik Usługi Roli
Baza wiedzy Wyszukiwanie AI platformy Azure Orkiestruje pipeline, zarządzając źródłami wiedzy i parametrami zapytań.
Źródło wiedzy Wyszukiwanie AI platformy Azure Definiuje treść używaną w potoku przetwarzania. Może być indeksowany (wspierany przez indeks wyszukiwania w usłudze) lub zdalny (zawartość pobierana w czasie zapytania z platformy zewnętrznej).
Indeks wyszukiwania Wyszukiwanie AI platformy Azure Przechowuje zawartość z możliwością wyszukiwania (tekst i wektory) przy użyciu konfiguracji semantycznej. Określa, które typy zapytań są uruchamiane i które optymalizacje mają zastosowanie. Wymagane tylko dla indeksowanych źródeł wiedzy.
Ranga semantyczna Wyszukiwanie AI platformy Azure Używany wewnętrznie przez potok wyszukiwania agentowego do ponownego szeregowania wyników według trafności (L2 reranking).
LLM (Magister Prawa) Azure OpenAI Może obsługiwać wiele etapów wyszukiwania agentowego: planowanie zapytań i wybieranie źródeł wiedzy (wersja zapoznawcza), podsumowywanie wyników z internetu oraz generowanie odpowiedzi z odwołaniami do źródeł w procesie syntezy odpowiedzi (wersja zapoznawcza).

Wymagania dotyczące integracji

Aplikacja steruje potokiem, wywołując bazę wiedzy i obsługując odpowiedź. Potok przetwarzania zwraca dane źródłowe, które można przekazać do modelu LLM w celu generowania odpowiedzi lub wykorzystać je bezpośrednio w interfejsie konwersacyjnym. Aby uzyskać szczegółowe informacje na temat implementacji, zobacz Samouczek: tworzenie kompletnego rozwiązania do autonomicznego pobierania.

Dostępność funkcji

Wyszukiwanie agentowe umożliwia korzystanie zarówno z funkcji dostępnych ogólnie, jak i funkcji w wersji zapoznawczej. Wybierz wersję interfejsu API REST usługi Search Service, która odpowiada środowisku wyszukiwania agentowego:

  • Użyj interfejsu API REST 2026-04-01 w przypadku obciążeń produkcyjnych, które korzystają z ogólnodostępnych typów źródeł wiedzy i minimalnego wyszukiwania ekstrakcyjnego.

  • Użyj interfejsu API REST 2026-08-01-preview do korzystania z typów i możliwości źródeł wiedzy w wersji zapoznawczej, takich jak planowanie zapytań oparte na modelach LLM, synteza odpowiedzi, rozszerzone wnioskowanie podczas pobierania danych oraz wiadomości wieloturowe. Zobacz Wyszukiwanie AI platformy Azure warunki wersji zapoznawczej.

Portale Azure i Microsoft Foundry zapewniają dostęp wyłącznie w wersji zapoznawczej do wszystkich możliwości wyszukiwania agentowego. Obiekty utworzone w obu portalach mogą używać schematów w wersji zapoznawczej i wymagać migracji po przejściu do ogólnie dostępnej wersji interfejsu API REST. Szczegółowe omówienie zmian w kolejnych wersjach oraz wskazówki dotyczące migracji znajdziesz tutaj: Migrowanie kodu agentowego wyszukiwania do najnowszej wersji.

Dostępność, limity i rozliczenia regionów

Zanim użyjesz wyszukiwania agentowego, zapoznaj się z informacjami o jego dostępności regionalnej, limitach usługi i modelu rozliczeń.

Dostępność regionu

Pobieranie danych agentowych jest dostępne w wybranych regionach.

Limits

Źródła wiedzy i bazy wiedzy mają maksymalne limity , które różnią się w zależności od warstwy cenowej i nakładu pracy z uzasadnieniem pobierania.

Fakturowanie

Odczytywanie agenta powoduje obciążenie opłatami przez dwa serwisy.

  • Wyszukiwanie AI platformy Azure obciąża za tokeny wyszukiwania zużyte w trakcie wykonywania podzapytania i rankingu semantycznego. Plan bezpłatny (wartość domyślna) zapewnia miesięczny limit tokenu. Plan standardowy umożliwia korzystanie z cennika z płatnością zgodnie z rzeczywistym użyciem po zużyciu bezpłatnego przydziału. Aby uzyskać więcej informacji, zobacz Włączanie lub wyłączanie rozliczeń za agentów.

  • Azure OpenAI nalicza opłaty za tokeny wejściowe i wyjściowe używane w planowaniu zapytań opartym na modelach LLM oraz w syntezie odpowiedzi (wersja zapoznawcza). Ceny zależą od rzeczywistego zużycia i są oparte na modelu przypisanym do bazy wiedzy. Opłaty są wyświetlane na rachunku za Azure OpenAI. Aby uzyskać stawki, zobacz cennik Azure OpenAI.

W poniższej tabeli porównujemy rozliczenia kosztów między klasycznym potokiem pojedynczego zapytania a potokiem wielokrotnego zapytania przy użyciu agenta. W klasycznym potoku składnikiem podlegającym opłatom jest semantyczny ranker.

Aspekt Potok klasyczny Powołaniowe pobieranie
Jednostki Oparte na zapytaniach Oparte na tokenach
Koszt na jednostkę Jednolity koszt zapytania Zmienny koszt tokenu (zależy od nakładu pracy umysłowej)
Szacowanie kosztów Szacowanie liczby zapytań Szacowanie użycia tokenu
Bezpłatny zasiłek Miesięczny limit bezpłatnych zapytań Miesięczny bezpłatny przydział tokenów

Przykład: Szacowanie kosztów

Ten przykład pomaga zilustrować proces szacowania kosztów na potrzeby planowania zapytań i wykonywania zapytań, ale nie syntezy odpowiedzi. Koszty mogą być niższe. Aby uzyskać aktualne stawki, zobacz cennik Wyszukiwanie AI platformy Azure i cennik Azure OpenAI.

Aby oszacować koszty planu zapytania w modelu płatności za rzeczywiste użycie w usłudze Azure OpenAI, załóżmy, że gpt-4o-mini:

  • 15 centów za 1 milion tokenów wejściowych.
  • 60 centów za 1 milion tokenów wyjściowych.
  • 2000 tokenów wejściowych dla średniego rozmiaru konwersacji na czacie.
  • 350 tokenów dla średniego rozmiaru planu wyjściowego.

Szacowane koszty rozliczeń związane z wykonywaniem zapytań

Aby oszacować liczbę tokenów pobierania agenta, zacznij od pojęcia, jak wygląda średni dokument w indeksie. Możesz na przykład przybliżyć następujące elementy:

  • 10 000 fragmentów, gdzie każdy fragment jest jednym do dwóch akapitów pliku PDF.
  • 500 tokenów na fragment.
  • Każde podzapytanie ponownie klasyfikuje do 50 fragmentów.
  • Średnio istnieją trzy podzapytania na plan zapytania.

Obliczanie ceny wykonania

  1. Załóżmy, że przeprowadzamy 2000 agentowych pobrań z trzema podzapytaniami na każdy plan. Daje nam to około 6000 łącznych zapytań.

  2. Przerysuj 50 fragmentów na podzapytanie, czyli 300 000 całkowitych fragmentów.

  3. Średni fragment to 500 tokenów, więc łączna liczba tokenów do ponownej oceny wynosi 150 milionów.

  4. Biorąc pod uwagę hipotetyczną cenę 0,022 za token, łączne koszty ponownego rankingowania wynoszą 3,30 USD w dolarach amerykańskich.

  5. Przejście do kosztów planu zapytania: 2000 tokenów wejściowych pomnożonych przez 2000 agentowych pobrań daje 4 miliony tokenów wejściowych, co przekłada się na łącznie 60 centów.

  6. Oszacuj koszty wyjściowe na podstawie średnio 350 tokenów. Jeśli pomnożymy 350 przez 2000 odczytów agentów, otrzymamy łącznie 700 000 tokenów wyjściowych, co daje łączny koszt 42 centów.

Łącząc to wszystko, zapłacisz około 3,30 USD za pobieranie agentów w usłudze Wyszukiwanie AI platformy Azure, 60 centów za tokeny wejściowe w usłudze Azure OpenAI oraz 42 centy za tokeny wyjściowe w usłudze Azure OpenAI, co daje łączną kwotę 1,02 USD za planowanie zapytań. Łączny koszt pełnego wykonania wynosi 4,32 USD.

Porady dotyczące kontrolowania kosztów

  • Przejrzyj dziennik aktywności w odpowiedzi, aby dowiedzieć się, jakie zapytania skierowano do jakich źródeł oraz jakie parametry użyto. Możesz powtórzyć te zapytania względem swoich indeksów i użyć publicznego tokenizatora do oszacowania tokenów i porównania z wykorzystaniem raportowanym przez API. Dokładna rekonstrukcja zapytania lub odpowiedzi nie jest jednak gwarantowana. Czynniki obejmują typ źródła wiedzy, takie jak publiczne dane internetowe lub zdalne SharePoint źródło wiedzy, które jest oparte na tożsamości użytkownika, które może mieć wpływ na reprodukcję zapytań.

  • Zmniejsz liczbę źródeł wiedzy (indeksy); konsolidacja zawartości może obniżyć zakres fan-out i ilość tokenów.

  • Obniż wysiłek związany z rozumowaniem, aby zmniejszyć wykorzystanie LLM podczas planowania i rozszerzania zapytań (wyszukiwanie iteracyjne).

  • Organizuj zawartość, aby można było znaleźć najbardziej istotne informacje z mniejszą liczbą źródeł i dokumentów (na przykład wyselekcjonowanych podsumowań lub tabel).

Jak rozpocząć

Aby utworzyć rozwiązanie wyszukiwania agentowego, możesz użyć portalu Azure, nowego portalu Microsoft Foundry, interfejsów API REST lub równoważnego pakietu SDK platformy Azure.

Następny krok