Azure Open Datasets

Popraw dokładność swoich modeli uczenia maszynowego za pomocą publicznie dostępnych zestawów danych. Aby zaoszczędzić czas na odnajdywanie i przygotowywanie danych, użyj wyselekcjonowanych zestawów danych gotowych do pracy z projektami uczenia maszynowego.

Transport

Zestaw danych Opis
TartanAir: Zestaw danych symulacji AirSim Dane pojazdów autonomicznych wygenerowane przez AirSim do rozwiązywania problemu jednoczesnej lokalizacji i mapowania (SLAM).
NYC Taxi & Limousine Commission - żółte rekordy przejazdów taksówką Rekordy przejazdów żółtymi taksówkami obejmują daty i godziny odbioru oraz wysadzenia, lokalizacje odbioru i wysadzenia, dystanse przejazdów, wyszczególnione opłaty, typy stawek, typy płatności oraz liczbę pasażerów zgłaszaną przez kierowców.
NYC Taxi & Limousine Commission - zielone rekordy przejazdów taksówką Rejestry przejazdów zielonych taksówek obejmują daty i godziny rozpoczęcia oraz zakończenia kursu, miejsca rozpoczęcia i zakończenia kursu, długości tras, szczegółowo wyszczególnione opłaty, typy stawek, typy płatności oraz liczbę pasażerów zgłaszaną przez kierowców.
NYC Taxi & Limousine Commission — rejestr przejazdów pojazdów wynajmowanych z kierowcą (FHV) Rejestry przejazdów pojazdów przewozu na zlecenie obejmują numer licencji bazy dyspozytorskiej oraz datę i godzinę odbioru, a także identyfikator lokalizacji strefy taksówkowej.

Praca i ekonomia

Zestaw danych Opis
US Labor Force Statistics (Statystyki dotyczące siły roboczej w USA) Statystyki siły roboczej w USA obejmują statystyki siły roboczej, wskaźniki aktywności zawodowej oraz cywilną ludność nieobjętą opieką instytucjonalną według wieku, płci, rasy i grup etnicznych w Stanach Zjednoczonych.
US National Employment Hours and Earnings (Liczba przepracowanych godzin i zarobki w skali kraju w USA) Program CES (Current Employment Statistics — aktualne statystyki zatrudnienia) generuje szczegółowe szacunkowe dane dotyczące zatrudnienia poza sektorem rolniczym, czasu pracy oraz wynagrodzeń pracowników zatrudnionych w różnych branżach w Stanach Zjednoczonych.
Godziny pracy i zarobki według stanów USA Program CES (Current Employment Statistics — aktualne statystyki zatrudnienia) generuje szczegółowe szacunkowe dane dotyczące zatrudnienia poza sektorem rolniczym, czasu pracy oraz wynagrodzeń pracowników zatrudnionych w różnych branżach w Stanach Zjednoczonych.
US Local Area Unemployment Statistics (Lokalne statystyki bezrobocia w USA) Zestawy danych programu US Local Area Unemployment Statistics (Lokalne statystyki bezrobocia w Stanach Zjednoczonych) dostarczają miesięcznych i rocznych danych dotyczących zatrudnienia, bezrobocia i zasobu siły roboczej w poszczególnych regionach i okręgach spisowych, stanach, hrabstwach, obszarach metropolitalnych i wielu miastach w Stanach Zjednoczonych.
Amerykański wskaźnik cen towarów i usług konsumpcyjnych Wskaźnik cen konsumpcyjnych (CPI) mierzy średnią zmianę cen w czasie płaconych przez konsumentów miejskich dla koszyka rynkowego towarów i usług konsumpcyjnych.
Amerykański wskaźnik cen dóbr produkcyjnych — przemysł Indeks cen producentów (PPI) mierzy średnią zmianę w miarę upływu czasu w cenach sprzedaży otrzymanych przez producentów krajowych za ich produkcję.
Amerykański wskaźnik cen dóbr produkcyjnych — towary Indeks cen producentów (PPI) mierzy średnią zmianę w miarę upływu czasu w cenach sprzedaży otrzymanych przez producentów krajowych za ich towary.

Populacja i bezpieczeństwo

Zestaw danych Opis
Populacja amerykańska według hrabstwa Liczba ludności USA według płci i rasy dla każdego hrabstwa w USA, na podstawie danych ze spisów powszechnych z 2000 i 2010 roku. Źródłem tego zestawu danych jest agencja Stany Zjednoczone Census Bureau.
Populacja amerykańska według kodu pocztowego Liczba ludności w USA według płci i rasy dla każdego amerykańskiego kodu ZIP, na podstawie spisu powszechnego z 2010 roku. Źródłem tego zestawu danych jest agencja Stany Zjednoczone Census Bureau.
Dane dotyczące bezpieczeństwa w Bostonie Przeczytaj dane dotyczące połączeń z numerem 311 zgłoszonych w Bostonie. Ten zestaw danych jest przechowywany w formacie Parquet i otrzymuje codzienne aktualizacje.
Chicagowskie dane dotyczące bezpieczeństwa Przeczytaj dane dotyczące połączeń z numerem 311 zgłoszonych w Chicago. Ten zestaw danych jest przechowywany w formacie Parquet i otrzymuje codzienne aktualizacje.
Dane dotyczące bezpieczeństwa w Nowym Jorku Ten zestaw danych zawiera wszystkie zgłoszenia na numer 311 w Nowym Jorku od roku 2010. Ten zestaw danych jest przechowywany w formacie Parquet i otrzymuje codzienne aktualizacje.
Dane dotyczące bezpieczeństwa w San Francisco Wezwania straży pożarnej oraz zgłoszenia na numer 311 w San Francisco. Ten zestaw danych zawiera historyczne rekordy od roku 2015.
Dane dotyczące bezpieczeństwa w Seattle Zgłoszenia na numer 911 straży pożarnej miasta Seattle. Ten zestaw danych jest codziennie aktualizowany i zawiera historyczne rekordy od roku 2010

Dodatkowe i typowe zestawy danych

Zestaw danych Opis
Cukrzyca Zestaw danych Diabetes (Cukrzyca) ma 442 próbki z 10 funkcjami, dzięki czemu doskonale nadaje się do rozpoczęcia korzystania z algorytmów uczenia maszynowego.
Symulowane dane sprzedażowe OJ Ten zestaw danych pochodzi z zestawu danych OJ Firmy Dominick i zawiera dodatkowe symulowane dane, a celem jest zapewnienie zestawu danych, który ułatwia jednoczesne trenowanie tysięcy modeli w usłudze Azure Machine Learning.
Baza danych odręcznych cyfr MNIST Baza danych napisanych odręcznie cyfr MNIST obejmuje zestaw treningowy zawierający 60 000 przykładów oraz zestaw testowy zawierający 10 000 przykładów. Cyfry są znormalizowane pod względem rozmiaru i wyśrodkowane na obrazie o stałym rozmiarze.
Zestaw danych rekomendacji usługi Microsoft News Microsoft News Dataset (MIND) to zestaw danych na dużą skalę na potrzeby badań rekomendacji dotyczących wiadomości. Służy jako referencyjny zbiór danych do rekomendowania wiadomości i ułatwia badania nad rekomendowaniem wiadomości oraz systemami rekomendacyjnymi.
Święta Dane dotyczące świąt na całym świecie pobrane z pakietu PyPI holidays oraz witryny Wikipedia, obejmujące 38 krajów i regionów w latach 1970–2099.
Rosyjskie otwarte rozpoznawanie mowy Russian Open STT to zakrojony na szeroką skalę otwarty zbiór danych do rozpoznawania mowy dla języka rosyjskiego