Indexes - Analyze
Montre comment un analyseur décompose le texte en jetons.
POST {endpoint}/indexes('{indexName}')/search.analyze?api-version=2026-04-01
Paramètres URI
| Nom | Dans | Obligatoire | Type | Description |
|---|---|---|---|---|
|
endpoint
|
path | True |
string (uri) |
URL du point de terminaison du service de recherche. |
|
index
|
path | True |
string |
Nom de l’index. |
|
api-version
|
query | True |
string minLength: 1 |
Version de l’API à utiliser pour cette opération. |
En-tête de la demande
| Nom | Obligatoire | Type | Description |
|---|---|---|---|
| Accept |
L’en-tête Accept. |
||
| x-ms-client-request-id |
string (uuid) |
Identificateur de chaîne opaque, globalement unique et généré par le client pour la requête. |
Corps de la demande
| Nom | Obligatoire | Type | Description |
|---|---|---|---|
| text | True |
string |
Texte à décomposer en jetons. |
| analyzer |
Nom de l’analyseur à utiliser pour interrompre le texte donné. Si ce paramètre n’est pas spécifié, vous devez spécifier un tokenizer à la place. Les paramètres de tokenizer et d’analyseur s’excluent mutuellement. |
||
| charFilters |
Liste facultative de filtres de caractères à utiliser lors de la rupture du texte donné. Ce paramètre ne peut être défini que lors de l’utilisation du paramètre tokenizer. |
||
| normalizer |
Nom du normaliseur à utiliser pour normaliser le texte donné. |
||
| tokenFilters |
Liste facultative de filtres de jetons à utiliser lors de la rupture du texte donné. Ce paramètre ne peut être défini que lors de l’utilisation du paramètre tokenizer. |
||
| tokenizer |
Nom du tokenizer à utiliser pour interrompre le texte donné. Si ce paramètre n’est pas spécifié, vous devez spécifier un analyseur à la place. Les paramètres de tokenizer et d’analyseur s’excluent mutuellement. |
Réponses
| Nom | Type | Description |
|---|---|---|
| 200 OK |
La demande a réussi. |
|
| Other Status Codes |
Réponse d’erreur inattendue. |
Sécurité
api-key
Type:
apiKey
Dans:
header
OAuth2Auth
Type:
oauth2
Flux:
implicit
URL d’autorisation:
https://login.microsoftonline.com/common/oauth2/v2.0/authorize
Étendues
| Nom | Description |
|---|---|
| https://search.azure.com/.default |
Exemples
SearchServiceIndexAnalyze
Exemple de requête
POST https://exampleservice.search.windows.net/indexes('example-index')/search.analyze?api-version=2026-04-01
{
"text": "Text to analyze",
"analyzer": "ar.lucene"
}
Exemple de réponse
{
"tokens": [
{
"token": "text",
"startOffset": 0,
"endOffset": 4,
"position": 0
},
{
"token": "to",
"startOffset": 5,
"endOffset": 7,
"position": 1
},
{
"token": "analyze",
"startOffset": 8,
"endOffset": 15,
"position": 2
}
]
}
Définitions
| Nom | Description |
|---|---|
| Accept |
L’en-tête Accept. |
|
Analyzed |
Informations sur un jeton retourné par un analyseur. |
|
Analyze |
Spécifie certains composants de texte et d’analyse utilisés pour décomposer ce texte en jetons. |
|
Analyze |
Résultat du test d’un analyseur sur du texte. |
|
Char |
Définit les noms de tous les filtres de caractères pris en charge par le moteur de recherche. |
|
Error |
Informations supplémentaires sur l’erreur de gestion des ressources. |
|
Error |
Détail de l’erreur. |
|
Error |
Réponse à l’erreur courante pour toutes les API Azure Resource Manager afin de renvoyer les détails d’erreur pour les opérations ratées. (Cela suit également le format de réponse d’erreur OData.). |
|
Lexical |
Définit les noms de tous les analyseurs de texte pris en charge par le moteur de recherche. |
|
Lexical |
Définit les noms de tous les normaliseurs de texte pris en charge par le moteur de recherche. |
|
Lexical |
Définit les noms de tous les tokenizers pris en charge par le moteur de recherche. |
|
Token |
Définit les noms de tous les filtres de jetons pris en charge par le moteur de recherche. |
Accept
L’en-tête Accept.
| Valeur | Description |
|---|---|
| application/json;odata.metadata=minimal |
AnalyzedTokenInfo
Informations sur un jeton retourné par un analyseur.
| Nom | Type | Description |
|---|---|---|
| endOffset |
integer (int32) |
Index du dernier caractère du jeton dans le texte d’entrée. |
| position |
integer (int32) |
Position du jeton dans le texte d’entrée par rapport à d’autres jetons. Le premier jeton du texte d’entrée a la position 0, la position suivante a la position 1, et ainsi de suite. Selon l’analyseur utilisé, certains jetons peuvent avoir la même position, par exemple s’ils sont synonymes les uns des autres. |
| startOffset |
integer (int32) |
Index du premier caractère du jeton dans le texte d’entrée. |
| token |
string |
Jeton retourné par l’analyseur. |
AnalyzeRequest
Spécifie certains composants de texte et d’analyse utilisés pour décomposer ce texte en jetons.
| Nom | Type | Description |
|---|---|---|
| analyzer |
Nom de l’analyseur à utiliser pour interrompre le texte donné. Si ce paramètre n’est pas spécifié, vous devez spécifier un tokenizer à la place. Les paramètres de tokenizer et d’analyseur s’excluent mutuellement. |
|
| charFilters |
Liste facultative de filtres de caractères à utiliser lors de la rupture du texte donné. Ce paramètre ne peut être défini que lors de l’utilisation du paramètre tokenizer. |
|
| normalizer |
Nom du normaliseur à utiliser pour normaliser le texte donné. |
|
| text |
string |
Texte à décomposer en jetons. |
| tokenFilters |
Liste facultative de filtres de jetons à utiliser lors de la rupture du texte donné. Ce paramètre ne peut être défini que lors de l’utilisation du paramètre tokenizer. |
|
| tokenizer |
Nom du tokenizer à utiliser pour interrompre le texte donné. Si ce paramètre n’est pas spécifié, vous devez spécifier un analyseur à la place. Les paramètres de tokenizer et d’analyseur s’excluent mutuellement. |
AnalyzeResult
Résultat du test d’un analyseur sur du texte.
| Nom | Type | Description |
|---|---|---|
| tokens |
Liste des jetons renvoyés par l’analyseur spécifié dans la demande. |
CharFilterName
Définit les noms de tous les filtres de caractères pris en charge par le moteur de recherche.
| Valeur | Description |
|---|---|
| html_strip |
Filtre de caractères qui tente de supprimer les constructions HTML. Voir https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html |
ErrorAdditionalInfo
Informations supplémentaires sur l’erreur de gestion des ressources.
| Nom | Type | Description |
|---|---|---|
| info |
Informations supplémentaires. |
|
| type |
string |
Type d’informations supplémentaire. |
ErrorDetail
Détail de l’erreur.
| Nom | Type | Description |
|---|---|---|
| additionalInfo |
Informations supplémentaires sur l’erreur. |
|
| code |
string |
Code d’erreur. |
| details |
Détails de l’erreur. |
|
| message |
string |
Message d’erreur. |
| target |
string |
Cible d’erreur. |
ErrorResponse
Réponse à l’erreur courante pour toutes les API Azure Resource Manager afin de renvoyer les détails d’erreur pour les opérations ratées. (Cela suit également le format de réponse d’erreur OData.).
| Nom | Type | Description |
|---|---|---|
| error |
Objet d’erreur. |
LexicalAnalyzerName
Définit les noms de tous les analyseurs de texte pris en charge par le moteur de recherche.
| Valeur | Description |
|---|---|
| ar.microsoft |
Analyseur Microsoft pour l’arabe. |
| ar.lucene |
Analyseur Lucene pour l’arabe. |
| hy.lucene |
Analyseur Lucene pour l’arménien. |
| bn.microsoft |
Analyseur Microsoft pour le bangla. |
| eu.lucene |
Analyseur Lucene pour le basque. |
| bg.microsoft |
Analyseur Microsoft pour le bulgare. |
| bg.lucene |
Analyseur Lucene pour le bulgare. |
| ca.microsoft |
Analyseur Microsoft pour le catalan. |
| ca.lucene |
Analyseur Lucene pour le catalan. |
| zh-Hans.microsoft |
Analyseur Microsoft pour le chinois (simplifié). |
| zh-Hans.lucene |
Analyseur Lucene pour le chinois (simplifié). |
| zh-Hant.microsoft |
Analyseur Microsoft pour le chinois (traditionnel). |
| zh-Hant.lucene |
Analyseur Lucene pour le chinois (traditionnel). |
| hr.microsoft |
Analyseur Microsoft pour le croate. |
| cs.microsoft |
Analyseur Microsoft pour le tchèque. |
| cs.lucene |
Analyseur Lucene pour le tchèque. |
| da.microsoft |
Analyseur Microsoft pour le danois. |
| da.lucene |
Analyseur Lucene pour le danois. |
| nl.microsoft |
Analyseur Microsoft pour le néerlandais. |
| nl.lucene |
Analyseur Lucene pour le néerlandais. |
| en.microsoft |
Analyseur Microsoft pour l’anglais. |
| en.lucene |
Analyseur Lucene pour l’anglais. |
| et.microsoft |
Analyseur Microsoft pour l’estonien. |
| fi.microsoft |
Analyseur Microsoft pour le finnois. |
| fi.lucene |
Analyseur Lucene pour le finnois. |
| fr.microsoft |
Analyseur Microsoft pour le français. |
| fr.lucene |
Analyseur Lucene pour le français. |
| gl.lucene |
Analyseur Lucene pour le galicien. |
| de.microsoft |
Analyseur Microsoft pour l’allemand. |
| de.lucene |
Analyseur Lucene pour l’allemand. |
| el.microsoft |
Analyseur Microsoft pour le grec. |
| el.lucene |
Analyseur Lucene pour le grec. |
| gu.microsoft |
Analyseur Microsoft pour le gujarati. |
| he.microsoft |
Analyseur Microsoft pour l’hébreu. |
| hi.microsoft |
Analyseur Microsoft pour l’hindi. |
| hi.lucene |
Analyseur Lucene pour l’hindi. |
| hu.microsoft |
Analyseur Microsoft pour le hongrois. |
| hu.lucene |
Analyseur Lucene pour le hongrois. |
| is.microsoft |
Analyseur Microsoft pour l’islandais. |
| id.microsoft |
Analyseur Microsoft pour l’indonésien (Bahasa). |
| id.lucene |
Analyseur Lucene pour l’indonésien. |
| ga.lucene |
Analyseur Lucene pour l’irlandais. |
| it.microsoft |
Analyseur Microsoft pour l’italien. |
| it.lucene |
Analyseur Lucene pour l’italien. |
| ja.microsoft |
Analyseur Microsoft pour le japonais. |
| ja.lucene |
Analyseur Lucene pour le japonais. |
| kn.microsoft |
Analyseur Microsoft pour le kannada. |
| ko.microsoft |
Analyseur Microsoft pour le coréen. |
| ko.lucene |
Analyseur Lucene pour le coréen. |
| lv.microsoft |
Analyseur Microsoft pour le letton. |
| lv.lucene |
Analyseur Lucene pour le letton. |
| lt.microsoft |
Analyseur Microsoft pour le lituanien. |
| ml.microsoft |
Analyseur Microsoft pour le malayalam. |
| ms.microsoft |
Analyseur Microsoft pour le malais (latin). |
| mr.microsoft |
Analyseur Microsoft pour le marathi. |
| nb.microsoft |
Microsoft analyzer pour le norvégien (Bokmål). |
| no.lucene |
Analyseur Lucene pour Norwegian. |
| fa.lucene |
Analyseur Lucene pour le persan. |
| pl.microsoft |
Analyseur Microsoft pour le polonais. |
| pl.lucene |
Analyseur Lucene pour le polonais. |
| pt-BR.microsoft |
Analyseur Microsoft pour le portugais (Brésil). |
| pt-BR.lucene |
Analyseur Lucene pour le portugais (Brésil). |
| pt-PT.microsoft |
Analyseur Microsoft pour le portugais (Portugal). |
| pt-PT.lucene |
Analyseur Lucene pour le portugais (Portugal). |
| pa.microsoft |
Analyseur Microsoft pour le pendjabi. |
| ro.microsoft |
Analyseur Microsoft pour roumain. |
| ro.lucene |
Analyseur Lucene pour roumain. |
| ru.microsoft |
Analyseur Microsoft pour le russe. |
| ru.lucene |
Analyseur Lucene pour le russe. |
| sr-cyrillic.microsoft |
Analyseur Microsoft pour le serbe (cyrillique). |
| sr-latin.microsoft |
Analyseur Microsoft pour serbe (latin). |
| sk.microsoft |
Analyseur Microsoft pour le slovaque. |
| sl.microsoft |
Analyseur Microsoft pour le slovène. |
| es.microsoft |
Analyseur Microsoft pour l’espagnol. |
| es.lucene |
Analyseur Lucene pour l’espagnol. |
| sv.microsoft |
Analyseur Microsoft pour le suédois. |
| sv.lucene |
Analyseur Lucene pour le suédois. |
| ta.microsoft |
Analyseur Microsoft pour le tamoul. |
| te.microsoft |
Analyseur Microsoft pour le télougou. |
| th.microsoft |
Analyseur Microsoft pour le thaï. |
| th.lucene |
Analyseur Lucene pour le thaïlandais. |
| tr.microsoft |
Analyseur Microsoft pour le turc. |
| tr.lucene |
Analyseur Lucene pour le turc. |
| uk.microsoft |
Analyseur Microsoft pour l’ukrainien. |
| ur.microsoft |
Analyseur Microsoft pour l’ourdou. |
| vi.microsoft |
Analyseur Microsoft pour le vietnamien. |
| standard.lucene |
Analyseur Lucene standard. |
| standardasciifolding.lucene |
Analyseur standard ASCII Folding Lucene. Voir https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers |
| keyword |
Traite l’intégralité du contenu d’un champ comme un seul jeton. Cela est utile pour les données telles que les codes postal, les ID et certains noms de produits. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html |
| pattern |
Sépare le texte de façon flexible en termes via un modèle d’expression régulière. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html |
| simple |
Divise le texte à l’endroit des caractères qui ne sont pas des lettres et le convertit en minuscules. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html |
| stop |
Divise le texte en lettres non lettres ; Applique les filtres de jetons minuscules et de mots vides. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html |
| whitespace |
Un analyseur qui utilise le générateur de jetons whitespace. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html |
LexicalNormalizerName
Définit les noms de tous les normaliseurs de texte pris en charge par le moteur de recherche.
| Valeur | Description |
|---|---|
| asciifolding |
Convertit les caractères Unicode alphabétiques, numériques et symboliques qui ne figurent pas dans les 127 premiers caractères ASCII (le bloc Unicode « Latin de base ») en leurs équivalents ASCII, s’il existe de tels équivalents. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html |
| elision |
Supprime les élisions. Par exemple, « l’avion » (l’avion) est converti en « avion » (avion). Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html |
| lowercase |
Normalise le texte du jeton en minuscules. Voir https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html |
| standard |
Normaliseur standard, qui se compose de minuscules et d’un repliement ascii. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html |
| uppercase |
Normalise le texte du jeton en majuscules. Voir https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html |
LexicalTokenizerName
Définit les noms de tous les tokenizers pris en charge par le moteur de recherche.
| Valeur | Description |
|---|---|
| classic |
Tokenizer basé sur la grammaire qui convient pour le traitement de la plupart des documents en langue européenne. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicTokenizer.html |
| edgeNGram |
Tokenise l’entrée d’un bord en n-grammes de la ou des tailles données. Voir https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenizer.html |
| keyword_v2 |
Génère la totalité de l’entrée sous la forme d’un unique jeton. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordTokenizer.html |
| letter |
Divise le texte aux caractères autres que des lettres. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LetterTokenizer.html |
| lowercase |
Divise le texte à l’endroit des caractères qui ne sont pas des lettres et le convertit en minuscules. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseTokenizer.html |
| microsoft_language_tokenizer |
Divise le texte en utilisant des règles spécifiques à la langue. |
| microsoft_language_stemming_tokenizer |
Divise le texte en utilisant des règles spécifiques à la langue et réduit les mots à leurs formes de base. |
| nGram |
Tokenise l’entrée en n-grammes de la ou des tailles données. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenizer.html |
| path_hierarchy_v2 |
Générateur de jetons pour les hiérarchies de type chemin. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/path/PathHierarchyTokenizer.html |
| pattern |
Tokenizer qui utilise le modèle regex correspondant pour construire des jetons distincts. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/pattern/PatternTokenizer.html |
| standard_v2 |
Analyseur Lucene standard ; Composé du générateur de jetons standard, du filtre minuscule et du filtre d’arrêt. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/StandardTokenizer.html |
| uax_url_email |
Identifie les URL et les e-mails comme un seul jeton. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/UAX29URLEmailTokenizer.html |
| whitespace |
Divise le texte aux espaces blancs. Voir http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceTokenizer.html |
TokenFilterName
Définit les noms de tous les filtres de jetons pris en charge par le moteur de recherche.