Modele generowania wideo
Wskazówka
Aby uzyskać więcej szczegółów, zobacz kartę Tekst i obrazy .
Oprócz obrazów statycznych coraz częściej spodziewamy się korzystania z zawartości wizualnej jako wideo.
Korzystanie z modeli generowania wideo z rozwiązania Foundry
Platforma Microsoft Foundry zawiera modele generowania wideo, których można użyć do tworzenia oryginalnej zawartości wideo.
Modele generowania wideo w rozwiązaniu Foundry obejmują:
- Sora 1: Sora jest pierwszym modelem tekst-wideo openAI udostępnionym w rozwiązaniu Microsoft Foundry. Generuje krótkie klipy wideo z monitów tekstowych , a także może używać obrazów jako danych wejściowych w celu pokierowania tworzeniem wideo. System Sora 1 obsługuje wiele rozdzielczości i czasów trwania i jest udostępniany za pośrednictwem usługi Azure OpenAI Service i platformy Video Playground rozwiązania Foundry na potrzeby eksperymentowania.
Typowe zastosowania:
- Wideo koncepcyjne i scenorysy
- Krótkie animacje z opisów tekstu
- Prototypowanie wizualne dla kreatywnych procesów pracy
Sora 2 (publiczna wersja zapoznawcza): Sora 2 to model generowania wideo nowej generacji w rozwiązaniu Foundry i stanowi znaczne uaktualnienie w systemie Sora 1. Obsługuje wiele modalności, w tym: tekst → wideo, obraz → wideo, wideo → wideo (remix). Sora 2 wprowadza również generowanie dźwięku, ulepszony realizm oraz możliwości remiksowania, które pozwalają na ukierunkowane edycje zamiast ponownego generowania całego wideo. Jest ona dostępna za pośrednictwem interfejsu API usługi Azure OpenAI w wersji 1 i platformy Azure Foundry Video Playground z wbudowanymi zabezpieczeniami odpowiedzialnej sztucznej inteligencji.
Typowe zastosowania:
- Filmy marketingowe i promocyjne
- Zapowiedzi i zwiastuny koncepcji filmowych
- Zawartość edukacyjna i immersywna multimediów
Uwaga / Notatka
Co ważne, modele Sora są obecnie jedynymi natywnymi modelami generowania wideo udostępnianymi bezpośrednio za pośrednictwem platformy Foundry. Inne modele Foundry mogą być multimodalne (tekst, obraz, dźwięk), ale nie generują wyjścia w postaci wideo. Zarówno Sora 1, jak i Sora 2 obejmują ograniczenia odpowiedzialnej sztucznej inteligencji, takie jak ograniczenia dotyczące prawdziwych osób, znaków chronionych prawem autorskim i niektórych typów zawartości.
Generowanie wideo w środowisku Foundry
Po wdrożeniu odpowiedniego modelu generowania wideo można go przetestować na placu zabaw portalu Foundry. Na placu zabaw można również określić parametry, takie jak wymiary wideo i czas trwania.
Twoje podpowiedzi dla modelu generowania wideo powinny zawierać opis zawartości w pożądanym filmie wideo. Po kilku minutach model tworzy film wideo.
Możesz zapoznać się z przykładowym kodem na placu zabaw.
Przykładowy kod używa interfejsu REST do generowania wideo.
Korzystanie z interfejsu REST na potrzeby generowania wideo
Interfejs REST usługi Foundry umożliwia zażądanie zadania generowania wideo i pobranie ukończonego pliku MP4 programowo. Programowe generowanie wideo umożliwia zautomatyzowanie procesu generowania wideo.
Uwaga / Notatka
API REST (Representational State Transfer) to interfejs sieciowy, który umożliwia programom komunikowanie się przy użyciu protokołu HTTP. SDK jako narzędzie przyjazne dla deweloperów oparte na tym interfejsie. Zawsze możesz pracować z bazowym interfejsem API REST, zwłaszcza jeśli zestaw SDK w języku programowania, który znasz, nie istnieje. Możesz użyć narzędzia curl (skrót od adresu URL klienta), aby wywołać interfejs API REST lub porozmawiać z nim. Curl to narzędzie wiersza polecenia służące do wysyłania i odbierania danych za pośrednictwem Internetu. W jego rdzeniu curl: wysyła żądania HTTP (i inne protokoły), wysyła dane do serwera i odbiera i drukuje odpowiedź serwera.
Generowanie wideo intensywnie obciąża zasoby i zwykle działa jako zadanie asynchroniczne.
Asynchroniczna oznacza, że:
- Utwórz pracę
- Sonduj stan zadania
- Pobierz film wideo po zakończeniu zadania.
Czasy generowania wideo są często 1–5 minut, w zależności od ustawień. Aby uruchomić zadanie asynchroniczne przy użyciu interfejsu REST usługi Foundry, potrzebne są następujące elementy:
- Zasób Azure OpenAI/Foundry w obsługiwanym regionie oraz wdrożenie Sora (usługę Sora wdrażasz z poziomu modeli i punktów końcowych rozwiązania Foundry).
- Metoda autoryzacji: klucz API lub Microsoft Entra ID
Przyjrzyjmy się, jak korzystać z interfejsu API Azure OpenAI w wersji 1 z modelem Sora 2.
Interfejs API Sora 2 udostępnia odrębne punkty końcowe dla:
- Uruchamianie zadania renderowania
- Sondowanie stanu zadania
- Pobieranie wideo
1. Utwórz zadanie wideo
W tym przykładzie skrypt uruchamia zadanie renderowania asynchronicznego i zwraca odpowiedź zawierającą identyfikator wideo do sondowania.
Uwaga / Notatka
Bash to powłoka wiersza polecenia i język skryptów. Curl to komenda uruchamiana w Bash.
curl -X POST "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/videos" \
-H "Content-Type: application/json" \
-H "api-key: $AZURE_OPENAI_API_KEY" \
-d '{
"model": "sora-2",
"prompt": "A cinematic close-up of raindrops sliding down a neon-lit window at night.",
"size": "1280x720",
"seconds": "8"
}'
2. Stan zadania sondowania do momentu ukończenia
W tym przykładzie skrypt sonduje punkt końcowy do momentu, gdy zadanie osiągnie completed (lub failed).
curl -X GET "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/videos/{video_id}" \
-H "api-key: $AZURE_OPENAI_API_KEY"
3. Pobierz ukończone wideo
Wideo jest pobierane tylko po osiągnięciu statusu completed.
curl -L "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/videos/{video_id}/content?variant=video" \
-H "api-key: $AZURE_OPENAI_API_KEY" \
--output output.mp4
Modele wideo są ulepszane przez cały czas, a rozwiązanie Microsoft Foundry ułatwia ich integrowanie z kreatywnymi rozwiązaniami. Następnie wypróbuj modele z obsługą obrazów, generowanie obrazów i generowanie wideo w rozwiązaniu Foundry samodzielnie.