Biblioteka Microsoft.Extensions.DataIngestion

📦 Pakiet Microsoft.Extensions.DataIngestion udostępnia podstawowe bloki konstrukcyjne platformy .NET na potrzeby pozyskiwania danych. Umożliwia deweloperom odczytywanie, przetwarzanie i przygotowywanie dokumentów dla przepływów pracy Sztucznej Inteligencji i uczenia maszynowego, zwłaszcza w scenariuszach Retrieval-Augmented Generation (RAG).

Dzięki tym blokom konstrukcyjnym można tworzyć niezawodne, elastyczne i inteligentne potoki pozyskiwania danych dostosowane do potrzeb aplikacji:

  • Ujednolicona reprezentacja dokumentu: Reprezentują dowolny typ pliku (na przykład PDF, Obraz lub Microsoft Word) w spójnym formacie, który dobrze współdziała z dużymi modelami językowymi.
  • Elastyczne pozyskiwanie danych: Odczytywanie dokumentów z usług chmurowych i lokalnych źródeł za pomocą różnych wbudowanych czytników, co ułatwia wprowadzanie danych z dowolnego miejsca.
  • Wbudowane ulepszenia sztucznej inteligencji: Automatycznie wzbogacaj zawartość za pomocą podsumowań, analizy tonacji, wyodrębniania słów kluczowych i klasyfikacji, przygotowywania danych do inteligentnych przepływów pracy.
  • Strategie fragmentowania z możliwością dostosowywania: Podziel dokumenty na fragmenty przy użyciu metod opartych na tokenach, opartych na sekcjach lub semantycznych, dzięki czemu można zoptymalizować potrzeby pobierania i analizy.
  • Przechowywanie gotowe do produkcji: Przechowuj przetworzone fragmenty w popularnych bazach danych wektorowych i magazynach dokumentów, z obsługą generowania wektoryzacji, dzięki czemu twoje potoki są gotowe do obsługi rzeczywistych scenariuszy.
  • Kompleksowa kompozycja potoku: Połącz ze sobą czytniki, procesory, fragmentatory i składniki zapisywania za pomocą interfejsu IngestionPipeline<T> API, zmniejszając standardowy schemat i ułatwiając tworzenie, dostosowywanie i rozszerzanie kompletnych przepływów pracy.
  • Wydajność i skalowalność: Zaprojektowane pod kątem skalowalnego przetwarzania danych te składniki mogą wydajnie obsługiwać duże ilości danych, dzięki czemu są odpowiednie dla aplikacji klasy korporacyjnej.

Wszystkie te składniki są otwarte i rozszerzalne zgodnie z projektem. Możesz dodać logikę niestandardową i nowe łączniki oraz rozszerzyć system w celu obsługi pojawiających się scenariuszy sztucznej inteligencji. Dzięki standaryzacji sposobu reprezentowania, przetwarzania i przechowywania dokumentów deweloperzy platformy .NET mogą tworzyć niezawodne, skalowalne i konserwowalne potoki danych bez konieczności ponownego tworzenia koła dla każdego projektu.

Zbudowany na stabilnych fundamentach

Diagram architektury pozyskiwania danych

Te bloki konstrukcyjne pozyskiwania danych są oparte na sprawdzonych i rozszerzalnych składnikach ekosystemu platformy .NET, zapewniając niezawodność, współdziałanie i bezproblemową integrację z istniejącymi przepływami pracy sztucznej inteligencji:

  • Microsoft.ML.Tokenizers: Tokenizatory stanowią podstawę fragmentowania dokumentów na podstawie tokenów. Umożliwia to precyzyjne dzielenie zawartości, co jest niezbędne do przygotowywania danych dla dużych modeli językowych i optymalizowania strategii pobierania.
  • Microsoft.Extensions.AI: Ten zestaw bibliotek obsługuje przekształcenia wzbogacania przy użyciu dużych modeli językowych. Umożliwia ona funkcjonalności, takie jak podsumowywanie, analiza sentymentu, ekstrakcja słów kluczowych i generowanie osadzeń, co ułatwia ulepszanie danych za pomocą inteligentnych informacji.
  • Microsoft.Extensions.VectorData: Ten zestaw bibliotek oferuje spójny interfejs do przechowywania przetworzonych fragmentów w wielu różnych magazynach wektorów, w tym Qdrant, Azure SQL, CosmosDB, MongoDB, ElasticSearch i wiele innych. Dzięki temu ścieżki przetwarzania danych są przygotowane do wdrożenia i mogą być skalowane w różnych systemach przechowywania.

Oprócz znanych wzorców i narzędzi te abstrakcji bazują na już rozszerzalnych składnikach. Możliwości i współdziałanie wtyczek są najważniejsze, więc wraz ze wzrostem pozostałych ekosystemów sztucznej inteligencji platformy .NET możliwości składników pozyskiwania danych również rosną. Takie podejście umożliwia deweloperom łatwe integrowanie nowych dostawców, rozszerzeń i opcji magazynowania, co pozwala na utrzymywanie ich potoków gotowych na przyszłość i dostosowanych do zmieniających się scenariuszy sztucznej inteligencji.

Zobacz także