Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ważna
Ta funkcja jest dostępna w wersji beta. Administratorzy obszaru roboczego mogą kontrolować dostęp do tej funkcji ze strony Podglądy . Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.
Note
Na tej stronie omówiono starą wersję wyodrębniania informacji. Usługa Databricks zaleca korzystanie z najnowszej wersji. Zobacz Wyodrębnianie informacji.
Na tej stronie opisano, jak utworzyć agenta AI do wyodrębniania informacji za pomocą funkcji Information Extraction.
Co to jest wyodrębnianie informacji?
Wyodrębnianie informacji obsługuje wyodrębnianie informacji i upraszcza proces przekształcania dużej liczby dokumentów tekstowych bez etykiet do tabeli ustrukturyzowanej z wyodrębnianymi informacjami dla każdego dokumentu.
Przykłady wyodrębniania informacji obejmują:
- Wyodrębnianie cen i informacji o dzierżawie z umów.
- Organizowanie danych z notatek klientów.
- Uzyskiwanie ważnych informacji z artykułów z wiadomościami.
Wyodrębnianie informacji wykorzystuje funkcje zautomatyzowanej oceny, w tym MLflow i Agent Evaluation, w celu umożliwienia szybkiej oceny kompromisu między kosztem a jakością dla twojego konkretnego zadania wyodrębniania. Ta ocena umożliwia podejmowanie świadomych decyzji dotyczących równowagi między dokładnością a inwestycjami w zasoby.
Wyodrębnianie informacji używa domyślnego magazynu do przechowywania tymczasowych przekształceń danych, punktów kontrolnych modelu i metadanych wewnętrznych, które zasilają każdego agenta. Po usunięciu agenta wszystkie dane skojarzone z agentem zostaną usunięte z domyślnego magazynu.
Requirements
- Obszar roboczy zawierający następujące elementy:
- Dostępne bezserwerowe zasoby obliczeniowe (domyślnie włączone w obszarach roboczych z Unity Catalog w obsługiwanym regionie).
- Katalog Unity jest włączony. Zobacz Umożliwienie obszaru roboczego dla Unity Catalog.
- Dostęp do modeli bazowych w katalogu Unity za pomocą schematu
system.ai. - Dostęp do zasad użycia bezserwerowego z budżetem niezerowym.
- Obszar roboczy w jednym z obsługiwanych regionów.
- Możliwość korzystania z
ai_queryfunkcji SQL. - Pliki, z których chcesz wyodrębnić dane. Pliki muszą znajdować się w woluminie katalogu Unity lub tabeli katalogu Unity.
- Jeśli chcesz użyć plików PDF, najpierw przekonwertuj je na tabelę Unity Catalog. Zobacz Korzystanie z plików PDF w wyodrębnianie informacji.
- Aby zbudować agenta, potrzebujesz co najmniej 1 nieoznaczonego dokumentu w woluminie Unity Catalog lub 1 wiersza w tabeli.
Tworzenie agenta wyodrębniania informacji
Przejdź do Agenci w okienku nawigacji po lewej stronie obszaru roboczego. Na kafelku Wyodrębnianie informacji kliknij pozycję Skompiluj.
Krok 1. Konfigurowanie agenta
Konfigurowanie agenta:
W polu Nazwa wprowadź nazwę agenta.
Wybierz typ danych, które chcesz podać. Możesz wybrać zestaw danych bez etykiet lub zestaw danych z etykietami.
Wybierz zestaw danych, który ma być udostępniony.
Zestaw danych bez etykiet
W przypadku wybrania zestawu danych bez etykiet:
W polu Lokalizacja zestawu danych wybierz folder lub tabelę, której chcesz użyć w Unity Catalog. W przypadku wybrania folderu folder musi zawierać dokumenty w obsługiwanym formacie dokumentu.
Oto przykładowy wolumin:
/Volumes/main/info-extraction/bbc_articles/Jeśli udostępniasz tabelę, wybierz kolumnę zawierającą dane tekstowe z listy rozwijanej. Kolumna tabeli musi zawierać dane w obsługiwanym formacie danych.
Jeśli chcesz użyć plików PDF, najpierw przekonwertuj je na tabelę Unity Catalog. Zobacz Korzystanie z plików PDF w wyodrębnianie informacji.
Wyodrębnianie informacji automatycznie wywnioskuje i generuje przykładowe wyjście JSON zawierające dane wyodrębnione z zestawu danych w polu Przykładowy kod JSON. Możesz zaakceptować przykładowe dane wyjściowe, edytować je lub zastąpić przykładem żądanych danych wyjściowych JSON. Agent zwraca wyodrębnione informacje przy użyciu tego formatu.
Zestaw danych z etykietami
Jeśli wybierzesz Etykietowany zestaw danych:
- W polu zbiór danych rzeczywistych wybierz tabelę Unity Catalog zawierającą dane rzeczywiste.
- W polu Kolumna danych wejściowych wybierz kolumnę zawierającą tekst, który ma zostać przetworzyny przez agenta. Dane w tej kolumnie muszą być w
strformacie. - W polu Kolumna wyników dla danych referencyjnych wybierz kolumnę zawierającą oczekiwane idealne odpowiedzi. Dane w tej kolumnie muszą być ciągiem JSON. Każdy wiersz w tej kolumnie musi być zgodny z tym samym formatem JSON. Wiersze zawierające dodatkowe lub brakujące klucze nie są dopuszczalne.
- W polu Przykładowe dane wyjściowe JSON Ekstrakcja informacji automatycznie generuje przykładowe dane wyjściowe JSON, używając pierwszego wiersza danych z kolumny z odpowiedziami uznanymi za prawdę. Sprawdź, czy te dane wyjściowe JSON są zgodne z oczekiwanym formatem.
Sprawdź, czy pole przykładowe dane wyjściowe JSON jest zgodne z żądanym formatem odpowiedzi. Edytuj zgodnie z potrzebami.
Na przykład następujące przykładowe dane wyjściowe JSON mogą służyć do wyodrębniania informacji z zestawu artykułów z wiadomościami:
{ "title": "Economy Slides to Recession", "category": "Politics", "paragraphs": [ { "summary": "GDP fell by 0.1% in the last three months of 2004.", "word_count": 38 }, { "summary": "Consumer spending had been depressed by one-off factors such as the unseasonably mild winter.", "word_count": 42 } ], "tags": ["Recession", "Economy", "Consumer Spending"], "estimate_time_to_read_min": 1, "published_date": "2005-01-15", "needs_review": false }W obszarze Wybór modelu wybierz najlepszy model dla agenta wyodrębniania informacji:
- Optymalizacja pod kątem skalowania (ustawienie domyślne): wybierz tę opcję, jeśli przetwarzasz duże ilości danych lub preferujesz ekonomicznego agenta. Ten model został zaprojektowany pod kątem wysokiej przepływności i szybszego czasu realizacji i jest odpowiedni dla większości zadań wyodrębniania informacji.
- Optymalizowanie pod kątem złożoności: wybierz tę opcję, jeśli potrzebujesz złożonego rozumowania i nadania priorytetów dokładności z szybkością i kosztami. Ten model oferuje wyższe możliwości rozumowania dla dłuższych dokumentów (takich jak zgłoszenia finansowe) i może obsługiwać bardziej złożone wyodrębniania (takie jak wyodrębnianie pól schematu 40+).
Kliknij pozycję Utwórz agenta.
Obsługiwane formaty dokumentów
W poniższej tabeli przedstawiono obsługiwane typy plików dokumentów dla dokumentów źródłowych, jeśli udostępnisz wolumin Unity Catalog.
| Pliki kodu | Pliki dokumentów | Pliki dziennika |
|---|---|---|
|
|
|
Obsługiwane formaty danych
Wyodrębnianie informacji obsługuje następujące typy danych i schematy danych dla dokumentów źródłowych, jeśli podasz tabelę Unity Catalog. Wyodrębnianie informacji może również wyodrębniać te typy danych z każdego dokumentu.
strintfloatboolean-
enum(używane w przypadku zadań klasyfikacji, w których agent powinien wybierać tylko z wstępnie zdefiniowanych kategorii) - Object
- Tablice
wyliczenie (odpowiednie dla zadań klasyfikacji, w których agent ma generować dane wyjściowe tylko z zestawu wstępnie zdefiniowanych kategorii) obiekt (zamiast "niestandardowych pól zagnieżdżonych") tablica
Krok 2. Ulepszanie agenta
Na karcie Kompilacja przejrzyj przykładowe dane wyjściowe, aby ułatwić uściślenie definicji schematu i dodanie instrukcji w celu uzyskania lepszych wyników.
Po lewej stronie przejrzyj przykładowe odpowiedzi i prześlij opinię, aby dostroić agenta. Te przykłady są oparte na bieżącej konfiguracji agenta.
- Kliknij wiersz, aby przejrzeć całość informacji i odpowiedzi.
- W dolnej części obok pozycji Czy ta odpowiedź jest poprawna?, prześlij opinię, wybierając
Tak lub
Napraw to. Aby zamieścić opinię o poprawce, podaj dodatkowe szczegóły dotyczące sposobu zmiany odpowiedzi agenta, a następnie kliknij
Zapisz.
- Po zakończeniu przeglądania wszystkich odpowiedzi kliknij
Tak, zaktualizuj agenta. Możesz też kliknąć pozycję Zapisz opinię i zaktualizować po przejrzeniu co najmniej trzech odpowiedzi.
Po prawej stronie w obszarze Pola wyjściowe uściślij opisy pól schematu wyodrębniania. Te opisy są tym, na czym agent się opiera, aby zrozumieć, co chcesz wyodrębnić. Użyj przykładowych odpowiedzi po lewej stronie, aby ułatwić uściślenie definicji schematu.
- Dla każdego pola przejrzyj i zmodyfikuj definicję schematu zgodnie z potrzebami. Użyj przykładowych odpowiedzi po lewej stronie, aby ułatwić uściślenie tych opisów.
- Aby edytować nazwę pola i wpisz, kliknij
Edytuj pole.
- Aby dodać nowe pole, kliknij
Dodaj nowe pole. Wprowadź nazwę, typ i opis, a następnie kliknij przycisk Potwierdź.
- Aby usunąć pole, kliknij ikonę kosza
- Kliknij przycisk Zapisz i zaktualizuj, aby zaktualizować konfigurację agenta.
(Opcjonalnie) Po prawej stronie w obszarze Instrukcje wprowadź wszelkie globalne instrukcje dotyczące agenta. Te instrukcje dotyczą wszystkich wyodrębnionych elementów. Kliknij przycisk Zapisz i zaktualizuj , aby zastosować instrukcje.
Nowe przykładowe odpowiedzi są generowane po lewej stronie. Przejrzyj te zaktualizowane odpowiedzi i kontynuuj uściślanie konfiguracji agenta, dopóki odpowiedzi nie będą zadowalające.
Krok 3. Korzystanie z agenta
Można używać swojego agenta w przepływach pracy w usłudze Databricks.
Aby rozpocząć korzystanie z agenta, kliknij przycisk Użyj. Możesz użyć agenta na kilka sposobów:
-
Wyodrębnij dane dla wszystkich dokumentów: kliknij przycisk Rozpocznij wyodrębnianie , aby otworzyć edytor SQL i użyć
ai_querypolecenia do wysyłania żądań do nowego agenta wyodrębniania informacji. - Utwórz potok ETL: kliknij pozycję Utwórz potok, aby wdrożyć potok uruchamiany w zaplanowanych odstępach czasu, aby używać agenta do nowych danych. Więcej informacji na temat potoków można znaleźć w sekcji Deklaratywne potoki Spark.
- Przetestuj agenta: kliknij pozycję Otwórz na placu zabaw , aby wypróbować agenta w środowisku testowym, aby zobaczyć, jak to działa. Więcej informacji o AI Playground znajdziesz w artykule Czatuj z LLM-ami i twórz prototypy aplikacji AI za pomocą AI Playground.
(Opcjonalnie) Krok 4. Ocena agenta
Aby upewnić się, że utworzono agenta wysokiej jakości, uruchom ocenę i przejrzyj wynikowy raport dotyczący jakości.
Przejdź do karty Jakość .
Kliknij
Uruchom ocenę.
W wyświetlonym okienku Nowa ocena skonfiguruj ocenę:
- Wybierz nazwę przebiegu oceny. Możesz użyć wygenerowanej nazwy lub podać nazwę niestandardową.
- Wybierz zestaw danych oceny. Możesz użyć tego samego źródłowego zestawu danych używanego do skompilowania agenta lub udostępnić niestandardowy zestaw danych oceny przy użyciu danych oznaczonych etykietami lub bez etykiet.
Kliknij przycisk Rozpocznij ocenę.
Po zakończeniu przebiegu oceny przejrzyj raport dotyczący jakości:
Widok Podsumowanie jest domyślnie wyświetlany. Przejrzyj ogólny raport dotyczący jakości, kosztów, przepływności i podsumowania metryk oceny. Kliknij
obok pola schematu, aby zobaczyć, jak to pole jest oceniane.
Przejdź do widoku Szczegółowe , aby uzyskać dodatkowe informacje. Ten widok przedstawia każde żądanie i wynik oceny dla każdej metryki. Kliknij żądanie, aby wyświetlić dodatkowe szczegóły, takie jak dane wejściowe, dane wyjściowe, oceny, ślady i połączone monity. Możesz również edytować oceny żądania i przekazać dodatkową opinię.
Wykonywanie zapytań względem punktu końcowego agenta
Na stronie agenta kliknij Zobacz Stan agenta w prawym górnym rogu, aby uzyskać wdrożony punkt końcowy agenta i wyświetlić szczegóły punktu końcowego.
Istnieje wiele sposobów wykonywania zapytań do utworzonego punktu końcowego agenta. Użyj przykładów kodu podanych w narzędziu AI Playground jako punktu wyjścia:
- Na stronie agenta kliknij pozycję Użyj.
- Kliknij Otwórz w środowisku testowym.
- W Playground kliknij pozycję Pobierz kod.
- Wybierz sposób używania punktu końcowego:
- Wybierz Zastosuj dla danych, aby utworzyć zapytanie SQL, które stosuje agenta do określonej kolumny tabeli.
- Wybierz pozycję Curl API dla przykładu kodu, aby wysłać zapytanie do punktu końcowego przy użyciu narzędzia curl.
- Wybierz Python API, aby uzyskać przykładowy kod do komunikacji z punktem końcowym za pomocą Pythona.
Zarządzanie uprawnieniami
Domyślnie tylko autorzy agentów i administratorzy obszaru roboczego mają uprawnienia do agenta. Aby zezwolić innym użytkownikom na edytowanie agenta lub wykonywanie względem nich zapytań, musisz jawnie udzielić im uprawnień.
Aby zarządzać uprawnieniami agenta:
- Otwórz agenta na stronie Agenci .
- W górnej części kliknij
- Kliknij pozycję Zarządzaj uprawnieniami.
- W oknie Ustawienia uprawnień wybierz użytkownika, grupę lub jednostkę usługi.
- Wybierz uprawnienie do udzielenia:
- Może zarządzać: umożliwia zarządzanie agentem, w tym ustawianie uprawnień, edytowanie konfiguracji agenta i poprawę jego jakości.
- Może wykonywać zapytania: umożliwia wykonywanie zapytań dotyczących punktu końcowego agenta na placu zabaw dla sztucznej inteligencji i za pośrednictwem interfejsu API. Użytkownicy z tym uprawnieniem nie mogą wyświetlać ani edytować agenta na stronie Agenci.
- Kliknij przycisk Dodaj.
- Kliknij Zapisz.
Note
W przypadku punktów końcowych agenta utworzonych przed 16 września 2025 r. można udzielić uprawnień Can Query punktom końcowym ze strony Obsługa punktów końcowych.
Korzystanie z plików PDF w wyodrębnianiu informacji
Pliki PDF nie są jeszcze obsługiwane natywnie w wyodrębniania informacji i niestandardowej funkcji LLM. Można jednak użyć przepływu pracy interfejsu użytkownika, aby przekonwertować folder plików PDF na format markdown, a następnie użyć wynikowej tabeli Unity Catalog jako danych wejściowych przy budowaniu agenta. Ten przepływ pracy wykorzystuje ai_parse_document do konwersji. Wykonaj te kroki:
Kliknij pozycję Agenci w okienku nawigacji po lewej stronie.
W przypadkach użycia wyodrębniania informacji lub niestandardowego modułu LLM kliknij pozycję Użyj plików PDF.
W wyświetlonym panelu bocznym wprowadź następujące pola, aby utworzyć nowy przepływ pracy, aby przekonwertować pliki PDF:
- Wybierz folder z plikami PDF lub obrazami: wybierz folder Unity Catalog zawierający pliki PDF, których chcesz użyć.
- Wybierz tabelę docelową: wybierz schemat docelowy dla przekonwertowanej tabeli markdown, a opcjonalnie dostosuj nazwę tabeli w polu poniżej.
- Wybierz aktywny magazyn SQL: wybierz magazyn SQL, aby uruchomić przepływ pracy.
Kliknij przycisk Rozpocznij importowanie.
Nastąpi przekierowanie do karty Wszystkie przepływy pracy , która zawiera listę wszystkich przepływów pracy w formacie PDF. Użyj tej karty, aby monitorować stan zadań.
Jeśli przepływ pracy zakończy się niepowodzeniem, kliknij nazwę zadania, aby go otworzyć i wyświetlić komunikaty o błędach, aby ułatwić debugowanie.
Po pomyślnym zakończeniu przepływu pracy kliknij nazwę zadania, aby otworzyć tabelę w Eksploratorze wykazu, aby eksplorować i zrozumieć kolumny.
Podczas konfigurowania agenta użyj tabeli katalogu Unity jako danych wejściowych.
Limitations
- Agenci wyodrębniania informacji mają maksymalną długość kontekstu tokenów wynoszącą 128k.
- Obszary robocze z włączonymi zwiększonymi zabezpieczeniami i zgodnością nie są obsługiwane.
- Typy schematów unii nie są obsługiwane.