Przykłady wnioskowania bezserwerowego interfejsu API dla modeli znalezionych (klasycznych)

Dotyczy tylko:Portal Foundry (klasyczny). Ten artykuł nie jest dostępny w nowym portalu Foundry. Dowiedz się więcej o nowym portalu.

Uwaga

Linki w tym artykule mogą otwierać zawartość w nowej dokumentacji Microsoft Foundry, w przeciwieństwie do dokumentacji Foundry (klasycznej), którą przeglądasz obecnie.

Katalog modeli foundry oferuje duży wybór modeli Microsoft Foundry od wielu dostawców. Dostępne są różne opcje wdrażania modeli z katalogu modeli. W tym artykule wymieniono przykłady wnioskowania dla wdrożeń bezserwerowego interfejsu API.

Ważne

Modele, które są w wersji zapoznawczej, są oznaczone jako wersja zapoznawcza na kartach modeli w wykazie modeli.

Aby przeprowadzić wnioskowanie z modelami, niektóre modele, takie jak TimeGEN-1 firmy Nixtla i Cohere rerank, wymagają użycia niestandardowych interfejsów API dostarczanych przez twórców modeli. Inne obsługują wnioskowanie przy użyciu API wnioskowania modelu. Więcej szczegółów na temat poszczególnych modeli można znaleźć, przeglądając karty modeli w katalogu modeli dla portalu Foundry.

Cohere

Rodzina modeli Cohere obejmuje różne modele zoptymalizowane pod kątem różnych przypadków użycia, w tym modele przeorganizowania, uzupełniania czatów i modele osadzające.

Przykłady wnioskowania: Polecenie Cohere i osadzanie

Poniższa tabela zawiera linki do przykładów używania modeli Cohere.

Opis Język Przykładowe
Żądania internetowe Bash Command-RCommand-R+
cohere-embed.ipynb
pakiet wnioskowania Azure AI dla języka C# C# Link
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
Pakiet wnioskowania Azure AI dla Python Python Link
Pakiet OpenAI SDK (eksperymentalny) Python Link
LangChain Python Link
Cohere SDK Python Polecenia
Osadź
LiteLLM SDK Python Link

Pobieranie Augmented Generation (RAG) i przykłady użycia narzędzi: Cohere Command i Embed

Opis Pakiety Przykładowe
Tworzenie lokalnego indeksu wektorów wyszukiwania sztucznej inteligencji (FAISS) w serwisie Facebook przy użyciu osadzania Cohere — Langchain langchain, langchain_cohere cohere_faiss_langchain_embed.ipynb
Użyj polecenia Cohere R/R+, aby odpowiedzieć na pytania z danych w lokalnym indeksie wektorów FAISS — Langchain langchain, langchain_cohere command_faiss_langchain.ipynb
Użyj polecenia Cohere R/R+, aby odpowiedzieć na pytania z danych w indeksie wektora wyszukiwania sztucznej inteligencji — Langchain langchain, langchain_cohere cohere-aisearch-langchain-rag.ipynb
Użyj Cohere Command R/R+, aby odpowiedzieć na pytania dotyczące danych w indeksie wektorów wyszukiwania AI - Cohere SDK cohere, azure_search_documents cohere-aisearch-rag.ipynb
Wywoływanie narzędzia/funkcji R+ przy użyciu LangChain cohere, langchain, langchain_cohere command_tools-langchain.ipynb

Cohere ponowne sortowanie

Aby przeprowadzać wnioskowanie za pomocą modeli Cohere Rerank, musisz używać niestandardowych interfejsów API Cohere Rerank. Aby uzyskać więcej informacji na temat modelu Cohere rerank i jego możliwości, zobacz Cohere reranke.

Ceny dla modeli Cohere rerank

Zapytania, które nie należy mylić z zapytaniem użytkownika, to miernik cen, który odnosi się do kosztów skojarzonych z tokenami używanymi jako dane wejściowe dla wnioskowania modelu Cohere Rerank. Cohere zlicza pojedynczą jednostkę wyszukiwania jako zapytanie z maksymalnie 100 dokumentami do sklasyfikowania. Dokumenty dłuższe niż 500 tokenów (dla Cohere-rerank-v3.5) lub dłuższe niż 4096 tokenów (dla Cohere-rerank-v3-English i Cohere-rerank-v3-wielojęzyczne) w przypadku uwzględnienia długości zapytania wyszukiwania są podzielone na wiele fragmentów, gdzie każdy fragment jest liczone jako pojedynczy dokument.

Zobacz kolekcję modeli Cohere w portalu Foundry.

Core42

Poniższa tabela zawiera linki do przykładów używania modeli Jais.

Opis Język Przykładowe
pakiet wnioskowania Azure AI dla języka C# C# Link
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
Pakiet wnioskowania Azure AI dla Python Python Link

DeepSeek

Rodzina modeli DeepSeek obejmuje DeepSeek-R1, który wyróżnia się w zadaniach wymagających rozumowania przy użyciu procesu trenowania krok po kroku, takich jak język, rozumowanie naukowe oraz zadania kodowania, a także DeepSeek-V3-0324, model językowy typu Mieszanka Ekspertów (MoE), a także inne.

Poniższa tabela zawiera linki do przykładów używania modeli DeepSeek.

Opis Język Przykładowe
Pakiet wnioskowania Azure AI dla Python Python Link
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
pakiet wnioskowania Azure AI dla języka C# C# Link
Pakiet wnioskowania sztucznej inteligencji Azure dla Java Java Link

Meta

Modele i narzędzia Meta Llama to kolekcja wstępnie wytrenowanych i dostrojonych modeli generowania tekstu i rozumowania obrazów sztucznej inteligencji. Zakres modeli metadanych jest skalowany w celu uwzględnienia:

  • Małe modele językowe (SLM), takie jak 1B i 3B Base i Instruct, dla inferencji na urządzeniach i na poziomie krawędzi
  • Średnie modele językowe (LLM), takie jak modele 7B, 8B i 70B *Base* i *Instruct*
  • Wysoce wydajne modele, takie jak Meta Llama 3.1-405B Instruct, do generowania syntetycznych danych i przypadków użycia destylacji.
  • Wysokowydajne natywne modele wielomodalne, Llama 4 Scout i Llama 4 Maverick, wykorzystują architekturę mieszanki ekspertów, aby zapewniać wiodącą w branży wydajność w rozumieniu tekstów i obrazów.

Poniższa tabela zawiera linki do przykładów używania modeli Meta Llama.

Opis Język Przykładowe
Żądanie CURL Bash Link
pakiet wnioskowania Azure AI dla języka C# C# Link
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
Pakiet wnioskowania Azure AI dla Python Python Link
Python żądania internetowe Python Link
Pakiet OpenAI SDK (eksperymentalny) Python Link
LangChain Python Link
LiteLLM Python Link

Microsoft

Microsoft modele obejmują różne grupy modeli, takie jak modele MAI, modele Phi, modele sztucznej inteligencji opieki zdrowotnej i inne. Aby wyświetlić wszystkie dostępne modele Microsoft, zobacz kolekcję modeli Microsoft w portalu Foundry.

Poniższa tabela zawiera linki do przykładów używania modeli Microsoft.

Opis Język Przykładowe
pakiet wnioskowania Azure AI dla języka C# C# Link
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
Pakiet wnioskowania Azure AI dla Python Python Link
LangChain Python Link
Llama-Index Python Link

Zobacz zbieranie modeli Microsoft w portalu Foundry.

Mistral Sztuczna Inteligencja

Mistral AI oferuje dwie kategorie modeli, a mianowicie:

  • Modele Premium: są to modele Mistral Large, Mistral Small, Mistral-OCR-2503, Mistral Medium 3 (25.05), Ministral 3B, oraz są dostępne jako bezserwerowe interfejsy API z rozliczeniami opartymi na tokenach, z opłatami zgodnie z użyciem.
  • Otwarte modele: należą do nich Mistral-small-2503, Codestral i Mistral Nemo (które są dostępne jako bezserwerowe interfejsy API z rozliczeniami opartymi na tokenach płatności zgodnie z rzeczywistym użyciem) i Mixtral-8x7B-Instruct-v01, Mixtral-8x7B-v01, Mistral-7B-Instruct-v01 i Mistral-7B-v01 (które są dostępne do pobierania i uruchamiania na własnych zarządzanych punktach końcowych).

Poniższa tabela zawiera linki do przykładów używania modeli Mistral.

Opis Język Przykładowe
Żądanie CURL Bash Link
pakiet wnioskowania Azure AI dla języka C# C# Link
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
Pakiet wnioskowania Azure AI dla Python Python Link
Python żądania internetowe Python Link
Pakiet OpenAI SDK (eksperymentalny) Python Mistral — przykład zestawu OpenAI SDK
LangChain Python Mistral — próbka LangChain
Mistral Sztuczna Inteligencja Python Mistral — przykład Mistral AI
LiteLLM Python Mistral — przykład LiteLLM

Nixtla

TimeGEN-1 firmy Nixtla to wstępnie wytrenowany model prognozowania i wykrywania anomalii dla danych szeregów czasowych. TimeGEN-1 może generować dokładne prognozy dla nowych szeregów czasowych bez trenowania, używając tylko wartości historycznych i kowariantów egzogennych jako danych wejściowych.

Aby przeprowadzić wnioskowanie, funkcja TimeGEN-1 wymaga użycia niestandardowego interfejsu API wnioskowania Nixtla. Aby uzyskać więcej informacji na temat modelu TimeGEN-1 i jego możliwości, zobacz Nixtla.

Szacowanie wymaganej liczby tokenów

Przed utworzeniem wdrożenia TimeGEN-1 warto oszacować liczbę tokenów, które planujesz wykorzystać i za które będziesz obciążony rachunkiem. Jeden token odpowiada jednemu punktowi danych w wejściowym zestawie danych lub wyjściowym zestawie danych.

Załóżmy, że masz następujący wejściowy zestaw danych szeregów czasowych:

Identyfikator_unikalny Sygnatura czasowa Zmienna docelowa Zmienna egzogenna 1 Zmienna egzogenna 2
BE 2016-10-22 00:00:00 70.00 49593.0 57253.0
BE 2016-10-22 01:00:00 37.10 46073.0 51887.0

Aby określić liczbę tokenów, należy pomnożyć liczbę wierszy (w tym przykładzie dwa) i liczbę kolumn używanych do prognozowania — nie licząc kolumn unique_id i sygnatur czasowych (w tym przykładzie trzy), aby uzyskać łącznie sześć tokenów.

Biorąc pod uwagę następujący wyjściowy zestaw danych:

Identyfikator_unikalny Sygnatura czasowa Prognozowana zmienna docelowa
BE 2016-10-22 02:00:00 46.57
BE 2016-10-22 03:00:00 48.57

Można również określić liczbę tokenów, zliczając liczbę punktów danych zwracanych po prognozowaniu danych. W tym przykładzie liczba tokenów to dwa.

Szacowanie cen na podstawie tokenów

Istnieją cztery mierniki cen, które określają cenę, którą płacisz. Te mierniki są następujące:

Miernik cen Opis
paygo-inference-input-tokens Koszty skojarzone z tokenami używanymi jako dane wejściowe do wnioskowania, gdy finetune_steps = 0
Tokiny wyjściowe inferencji paygo Koszty skojarzone z tokenami używanymi jako dane wyjściowe do wnioskowania, gdy finetune_steps = 0
doprogramowany model wnioskowania paygo input-tokens Koszty skojarzone z tokenami używanymi jako dane wejściowe do wnioskowania, gdy finetune_steps> 0
tok-ucz-wynikowy-modelu-dostosowanego-paygo (Note: "tok-ucz" is an abbreviation suggestion since "output-tokens" doesn't have a direct translation but can be interpreted as "tok-ucz" short for "tokeny uczące", meaning learning tokens. Ensure to provide a sufficient explanation or use a more contextually fitting term based on the actual use case or local understanding.) Koszty skojarzone z tokenami używanymi jako dane wyjściowe do wnioskowania, gdy finetune_steps> 0

Zobacz kolekcję modeli Nixtla w portalu Foundry.

Stabilność sztucznej inteligencji

Modele Stability AI wdrożone za pomocą bezserwerowego API implementują API inferencji modelu na trasie /image/generations. Przykłady użycia modeli Stability AI można znaleźć w następujących przykładach:

Nawigator Gretel

Gretel Navigator wykorzystuje złożoną architekturę sztucznej inteligencji specjalnie zaprojektowaną dla danych syntetycznych, łącząc najlepsze modele małych języków typu open source (SLM) dostosowane w ponad 10 domenach branżowych. Ten specjalnie utworzony system tworzy zróżnicowane zestawy danych specyficzne dla domeny w skali setek do milionów przykładów. System zachowuje również złożone relacje statystyczne i oferuje większą szybkość i dokładność w porównaniu z ręcznym tworzeniem danych.

Opis Język Przykładowe
Pakiet wnioskowania Azure AI dla języka JavaScript JavaScript Link
Pakiet wnioskowania Azure AI dla Python Python Link