Indexes - Analyze

Mostra como um analisador divide o texto em tokens.

POST {endpoint}/indexes('{indexName}')/search.analyze?api-version=2026-04-01

Parâmetros do URI

Name Em Necessário Tipo Description
endpoint
path True

string (uri)

A URL do ponto de extremidade do serviço de pesquisa.

indexName
path True

string

O nome do índice.

api-version
query True

string

minLength: 1

A versão da API a utilizar para esta operação.

Cabeçalho do Pedido

Name Necessário Tipo Description
Accept

Accept

O cabeçalho Aceitar.

x-ms-client-request-id

string (uuid)

Um identificador de string opaco, globalmente único e gerado pelo cliente para o pedido.

Corpo do Pedido

Name Necessário Tipo Description
text True

string

O texto para dividir em tokens.

analyzer

LexicalAnalyzerName

O nome do analisador a ser usado para quebrar o texto fornecido. Se esse parâmetro não for especificado, você deverá especificar um tokenizador. Os parâmetros do tokenizador e do analisador são mutuamente exclusivos.

charFilters

CharFilterName[]

Uma lista opcional de filtros de caracteres para usar ao quebrar o texto determinado. Este parâmetro só pode ser definido ao usar o parâmetro tokenizer.

normalizer

LexicalNormalizerName

O nome do normalizador a ser usado para normalizar o texto fornecido.

tokenFilters

TokenFilterName[]

Uma lista opcional de filtros de token para usar ao quebrar o texto fornecido. Este parâmetro só pode ser definido ao usar o parâmetro tokenizer.

tokenizer

LexicalTokenizerName

O nome do tokenizador a ser usado para quebrar o texto fornecido. Se esse parâmetro não for especificado, você deverá especificar um analisador. Os parâmetros do tokenizador e do analisador são mutuamente exclusivos.

Respostas

Name Tipo Description
200 OK

AnalyzeResult

O pedido foi bem-sucedido.

Other Status Codes

ErrorResponse

Uma resposta de erro inesperada.

Segurança

api-key

Tipo: apiKey
Em: header

OAuth2Auth

Tipo: oauth2
Fluxo: implicit
URL de Autorização: https://login.microsoftonline.com/common/oauth2/v2.0/authorize

Âmbitos

Name Description
https://search.azure.com/.default

Exemplos

SearchServiceIndexAnalyze

Pedido de amostra

POST https://exampleservice.search.windows.net/indexes('example-index')/search.analyze?api-version=2026-04-01


{
  "text": "Text to analyze",
  "analyzer": "ar.lucene"
}

Resposta da amostra

{
  "tokens": [
    {
      "token": "text",
      "startOffset": 0,
      "endOffset": 4,
      "position": 0
    },
    {
      "token": "to",
      "startOffset": 5,
      "endOffset": 7,
      "position": 1
    },
    {
      "token": "analyze",
      "startOffset": 8,
      "endOffset": 15,
      "position": 2
    }
  ]
}

Definições

Name Description
Accept

O cabeçalho Aceitar.

AnalyzedTokenInfo

Informações sobre um token retornado por um analisador.

AnalyzeRequest

Especifica alguns componentes de texto e análise usados para dividir esse texto em tokens.

AnalyzeResult

O resultado do teste de um analisador em texto.

CharFilterName

Define os nomes de todos os filtros de caracteres suportados pelo mecanismo de pesquisa.

ErrorAdditionalInfo

O erro de gerenciamento de recursos informações adicionais.

ErrorDetail

O detalhe do erro.

ErrorResponse

Resposta de erro comum para todas as APIs do Azure Resource Manager devolver detalhes de erro para operações falhadas. (Isso também segue o formato de resposta de erro OData.)

LexicalAnalyzerName

Define os nomes de todos os analisadores de texto suportados pelo mecanismo de pesquisa.

LexicalNormalizerName

Define os nomes de todos os normalizadores de texto suportados pelo mecanismo de pesquisa.

LexicalTokenizerName

Define os nomes de todos os tokenizadores suportados pelo mecanismo de pesquisa.

TokenFilterName

Define os nomes de todos os filtros de token suportados pelo mecanismo de pesquisa.

Accept

O cabeçalho Aceitar.

Valor Description
application/json;odata.metadata=minimal

AnalyzedTokenInfo

Informações sobre um token retornado por um analisador.

Name Tipo Description
endOffset

integer (int32)

O índice do último caractere do token no texto de entrada.

position

integer (int32)

A posição do token no texto de entrada em relação a outros tokens. O primeiro token no texto de entrada tem a posição 0, o próximo tem a posição 1 e assim por diante. Dependendo do analisador usado, alguns tokens podem ter a mesma posição, por exemplo, se forem sinônimos uns dos outros.

startOffset

integer (int32)

O índice do primeiro caractere do token no texto de entrada.

token

string

O token retornado pelo analisador.

AnalyzeRequest

Especifica alguns componentes de texto e análise usados para dividir esse texto em tokens.

Name Tipo Description
analyzer

LexicalAnalyzerName

O nome do analisador a ser usado para quebrar o texto fornecido. Se esse parâmetro não for especificado, você deverá especificar um tokenizador. Os parâmetros do tokenizador e do analisador são mutuamente exclusivos.

charFilters

CharFilterName[]

Uma lista opcional de filtros de caracteres para usar ao quebrar o texto determinado. Este parâmetro só pode ser definido ao usar o parâmetro tokenizer.

normalizer

LexicalNormalizerName

O nome do normalizador a ser usado para normalizar o texto fornecido.

text

string

O texto para dividir em tokens.

tokenFilters

TokenFilterName[]

Uma lista opcional de filtros de token para usar ao quebrar o texto fornecido. Este parâmetro só pode ser definido ao usar o parâmetro tokenizer.

tokenizer

LexicalTokenizerName

O nome do tokenizador a ser usado para quebrar o texto fornecido. Se esse parâmetro não for especificado, você deverá especificar um analisador. Os parâmetros do tokenizador e do analisador são mutuamente exclusivos.

AnalyzeResult

O resultado do teste de um analisador em texto.

Name Tipo Description
tokens

AnalyzedTokenInfo[]

A lista de tokens retornados pelo analisador especificado na solicitação.

CharFilterName

Define os nomes de todos os filtros de caracteres suportados pelo mecanismo de pesquisa.

Valor Description
html_strip

Um filtro de caracteres que tenta remover construções HTML. Veja https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/charfilter/HTMLStripCharFilter.html

ErrorAdditionalInfo

O erro de gerenciamento de recursos informações adicionais.

Name Tipo Description
info

As informações adicionais.

type

string

O tipo de informação adicional.

ErrorDetail

O detalhe do erro.

Name Tipo Description
additionalInfo

ErrorAdditionalInfo[]

O erro informações adicionais.

code

string

O código de erro.

details

ErrorDetail[]

Os detalhes do erro.

message

string

A mensagem de erro.

target

string

O alvo do erro.

ErrorResponse

Resposta de erro comum para todas as APIs do Azure Resource Manager devolver detalhes de erro para operações falhadas. (Isso também segue o formato de resposta de erro OData.)

Name Tipo Description
error

ErrorDetail

O objeto de erro.

LexicalAnalyzerName

Define os nomes de todos os analisadores de texto suportados pelo mecanismo de pesquisa.

Valor Description
ar.microsoft

Analisador Microsoft para árabe.

ar.lucene

Analisador de Lucene para árabe.

hy.lucene

Analisador de Lucene para arménio.

bn.microsoft

Analisador Microsoft para Bangla.

eu.lucene

Analisador Lucene para basco.

bg.microsoft

Analisador Microsoft para búlgaro.

bg.lucene

Lucene analisador para búlgaro.

ca.microsoft

Analisador Microsoft para catalão.

ca.lucene

Lucene analisador para catalão.

zh-Hans.microsoft

Analisador Microsoft para chinês (Simplificado).

zh-Hans.lucene

Analisador Lucene para chinês (simplificado).

zh-Hant.microsoft

Analisador Microsoft para chinês (tradicional).

zh-Hant.lucene

Analisador de Lucene para chinês (tradicional).

hr.microsoft

Analisador Microsoft para croata.

cs.microsoft

Analisador Microsoft para checo.

cs.lucene

Lucene analisador para checo.

da.microsoft

Analisador Microsoft para dinamarquês.

da.lucene

Lucene analisador para dinamarquês.

nl.microsoft

Analisador Microsoft para holandês.

nl.lucene

Analisador Lucene para holandês.

en.microsoft

Analisador Microsoft para inglês.

en.lucene

Analisador Lucene para Inglês.

et.microsoft

Analisador Microsoft para estónio.

fi.microsoft

Analisador Microsoft para finlandês.

fi.lucene

Analisador de Lucene para finlandês.

fr.microsoft

Analisador Microsoft para francês.

fr.lucene

Analisador Lucene para francês.

gl.lucene

Lucene analisador para galego.

de.microsoft

Analisador Microsoft para alemão.

de.lucene

Lucene analisador para alemão.

el.microsoft

Analisador Microsoft para grego.

el.lucene

Analisador de Lucene para grego.

gu.microsoft

Analisador Microsoft para Gujarati.

he.microsoft

Analisador Microsoft para hebraico.

hi.microsoft

Analisador Microsoft para Hindi.

hi.lucene

Analisador de Lucene para Hindi.

hu.microsoft

Analisador Microsoft para húngaro.

hu.lucene

Lucene analisador para húngaro.

is.microsoft

Analisador Microsoft para islandês.

id.microsoft

Analisador Microsoft para Indonésio (Bahasa).

id.lucene

Analisador de Lucene para indonésio.

ga.lucene

Lucene analisador para irlandês.

it.microsoft

Analisador Microsoft para italiano.

it.lucene

Analisador Lucene para italiano.

ja.microsoft

Analisador Microsoft para japonês.

ja.lucene

Analisador Lucene para japonês.

kn.microsoft

Analisador Microsoft para Kannada.

ko.microsoft

Analisador Microsoft para coreano.

ko.lucene

Analisador Lucene para coreano.

lv.microsoft

Analisador Microsoft para letão.

lv.lucene

Analisador Lucene para letão.

lt.microsoft

Analisador Microsoft para lituano.

ml.microsoft

Analisador Microsoft para malaiala.

ms.microsoft

Analisador Microsoft para malaio (latim).

mr.microsoft

Analisador Microsoft para Marathi.

nb.microsoft

Microsoft analyzer for Norwegian (Bokmål).

no.lucene

Analisador Lucene para norueguês.

fa.lucene

Analisador de Lucene para persa.

pl.microsoft

Analisador Microsoft para polaco.

pl.lucene

Analisador de Lucene para polaco.

pt-BR.microsoft

Analisador Microsoft para português (Brasil).

pt-BR.lucene

Analisador Lucene para Português (Brasil).

pt-PT.microsoft

Analisador Microsoft para português (Portugal).

pt-PT.lucene

Analisador de Lucene para Português (Portugal).

pa.microsoft

Analisador Microsoft para Punjabi.

ro.microsoft

Analisador Microsoft para romeno.

ro.lucene

Lucene analisador para romeno.

ru.microsoft

Analisador Microsoft para russo.

ru.lucene

Lucene analisador para russo.

sr-cyrillic.microsoft

Analisador Microsoft para sérvio (cirílico).

sr-latin.microsoft

Analisador Microsoft para sérvio (latim).

sk.microsoft

Analisador Microsoft para eslovaco.

sl.microsoft

Analisador Microsoft para esloveno.

es.microsoft

Analisador Microsoft para espanhol.

es.lucene

Analisador Lucene para espanhol.

sv.microsoft

Analisador Microsoft para sueco.

sv.lucene

Lucene analisador para sueco.

ta.microsoft

Analisador Microsoft para tâmil.

te.microsoft

Analisador Microsoft para Telugu.

th.microsoft

Analisador Microsoft para tailandês.

th.lucene

Lucene analisador para tailandês.

tr.microsoft

Analisador Microsoft para turco.

tr.lucene

Lucene analisador para turco.

uk.microsoft

Analisador Microsoft para ucraniano.

ur.microsoft

Analisador Microsoft para urdu.

vi.microsoft

Analisador Microsoft para vietnamita.

standard.lucene

Analisador Lucene padrão.

standardasciifolding.lucene

Analisador padrão ASCII Folding Lucene. Veja https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#Analyzers

keyword

Trata todo o conteúdo de um campo como um único token. Isso é útil para dados como códigos postais, ids e alguns nomes de produtos. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordAnalyzer.html

pattern

Separa o texto de forma flexível em termos através de um padrão de expressão regular. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/PatternAnalyzer.html

simple

Divide o texto em letras não escritas e converte-as em minúsculas. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/SimpleAnalyzer.html

stop

Divide o texto em não-letras; Aplica os filtros de token minúsculo e stopword. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopAnalyzer.html

whitespace

Um analisador que utiliza o tokenizador de espaços em branco. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceAnalyzer.html

LexicalNormalizerName

Define os nomes de todos os normalizadores de texto suportados pelo mecanismo de pesquisa.

Valor Description
asciifolding

Converte caracteres Unicode alfabéticos, numéricos e simbólicos que não estão nos primeiros 127 caracteres ASCII (o bloco Unicode "Basic Latin") em seus equivalentes ASCII, se tais equivalentes existirem. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

elision

Remove elisões. Por exemplo, "l'avion" (o avião) será convertido em "avion" (avião). Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

lowercase

Normaliza o texto do token para minúsculas. Veja https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

standard

Normalizador padrão, que consiste em minúsculas e asciifolding. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

uppercase

Normaliza o texto do token para maiúsculas. Veja https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

LexicalTokenizerName

Define os nomes de todos os tokenizadores suportados pelo mecanismo de pesquisa.

Valor Description
classic

Tokenizador baseado em gramática que é adequado para processar a maioria dos documentos em língua europeia. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicTokenizer.html

edgeNGram

Tokeniza a entrada de uma borda em n-gramas do(s) tamanho(s) determinado(s). Veja https://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenizer.html

keyword_v2

Emite toda a entrada como um único token. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/KeywordTokenizer.html

letter

Divide o texto em pontos onde não há letras. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LetterTokenizer.html

lowercase

Divide o texto em letras não escritas e converte-as em minúsculas. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/LowerCaseTokenizer.html

microsoft_language_tokenizer

Divide o texto usando regras específicas do idioma.

microsoft_language_stemming_tokenizer

Divide o texto usando regras específicas do idioma e reduz as palavras às suas formas base.

nGram

Tokeniza a entrada em n-gramas do(s) tamanho(s) fornecido(s). Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenizer.html

path_hierarchy_v2

Tokenizador para hierarquias semelhantes a caminhos. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/path/PathHierarchyTokenizer.html

pattern

Tokenizador que usa a correspondência de padrões regex para construir tokens distintos. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/pattern/PatternTokenizer.html

standard_v2

Analisador padrão de Lucene; Composto pelo tokenizador padrão, filtro minúsculo e filtro stop. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/StandardTokenizer.html

uax_url_email

Tokeniza URLs e e-mails como um único token. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/UAX29URLEmailTokenizer.html

whitespace

Divide o texto no espaço em branco. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/WhitespaceTokenizer.html

TokenFilterName

Define os nomes de todos os filtros de token suportados pelo mecanismo de pesquisa.

Valor Description
arabic_normalization

Um filtro simbólico que aplica o normalizador árabe para normalizar a ortografia. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ar/ArabicNormalizationFilter.html

apostrophe

Remove todos os caracteres após um apóstrofo (incluindo o próprio apóstrofo). Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/tr/ApostropheFilter.html

asciifolding

Converte caracteres Unicode alfabéticos, numéricos e simbólicos que não estão nos primeiros 127 caracteres ASCII (o bloco Unicode "Basic Latin") em seus equivalentes ASCII, se tais equivalentes existirem. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ASCIIFoldingFilter.html

cjk_bigram

Forma bigramas de termos CJK que são gerados a partir do tokenizador padrão. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKBigramFilter.html

cjk_width

Normaliza as diferenças de largura do CJK. Dobra variantes ASCII de largura total no latim básico equivalente, e variantes Katakana de meia largura no Kana equivalente. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/cjk/CJKWidthFilter.html

classic

Remove possessivos em inglês e pontos de siglas. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/standard/ClassicFilter.html

common_grams

Construa bigramas para termos frequentes durante a indexação. Os termos isolados também continuam a ser indexados, com bigramas sobrepostos. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/commongrams/CommonGramsFilter.html

edgeNGram_v2

Gera n-gramas do(s) tamanho(s) determinado(s) a partir da frente ou do verso de um token de entrada. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/EdgeNGramTokenFilter.html

elision

Remove elisões. Por exemplo, "l'avion" (o avião) será convertido em "avion" (avião). Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/util/ElisionFilter.html

german_normalization

Normaliza caracteres alemães de acordo com a heurística do algoritmo de bola de neve German2. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/de/GermanNormalizationFilter.html

hindi_normalization

Normaliza o texto em hindi para remover algumas diferenças nas variações ortográficas. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/hi/HindiNormalizationFilter.html

indic_normalization

Normaliza a representação Unicode de texto em idiomas indianos. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/in/IndicNormalizationFilter.html

keyword_repeat

Emite cada token recebido duas vezes, uma como palavra-chave e outra como não-palavra-chave. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/KeywordRepeatFilter.html

kstem

Um filtro kstem de alto desempenho para inglês. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/en/KStemFilter.html

length

Remove palavras muito longas ou curtas. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LengthFilter.html

limit

Limita o número de tokens durante a indexação. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/LimitTokenCountFilter.html

lowercase

Normaliza o texto do token para minúsculas. Veja https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/LowerCaseFilter.html

nGram_v2

Gera n-gramas do(s) tamanho(s) fornecido(s). Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ngram/NGramTokenFilter.html

persian_normalization

Aplica normalização do farsi. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/fa/PersianNormalizationFilter.html

phonetic

Crie tokens para correspondências fonéticas. Veja https://lucene.apache.org/core/4_10_3/analyzers-phonetic/org/apache/lucene/analysis/phonetic/package-tree.html

porter_stem

Usa o algoritmo de derivação de Porter para transformar o fluxo de token. Veja http://tartarus.org/~martin/PorterStemmer

reverse

Inverte a sequência de caracteres do token. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/reverse/ReverseStringFilter.html

scandinavian_normalization

Normaliza o uso dos caracteres escandinavos intercambiáveis. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianNormalizationFilter.html

scandinavian_folding

Dobra caracteres escandinavos Ã¥ã... äæÃ"Æ-a> e öÖà ̧à ̃-o>. Também discrimina o uso de vogais duplas aa, ae, ao, oe e oo, deixando apenas a primeira. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/ScandinavianFoldingFilter.html

shingle

Cria combinações de tokens como um único token. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/shingle/ShingleFilter.html

snowball

Um filtro que deriva palavras usando um lematizador gerado por Bola-de-Neve. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/snowball/SnowballFilter.html

sorani_normalization

Normaliza a representação Unicode do texto de Sorani. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/ckb/SoraniNormalizationFilter.html

stemmer

Filtro de derivação específico da linguagem. Veja https://learn.microsoft.com/rest/api/searchservice/Custom-analyzers-in-Azure-Search#TokenFilters

stopwords

Remove palavras irrelevantes de um fluxo de tokens. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/core/StopFilter.html

trim

Remove o espaço em branco no início e no fim dos tokens. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TrimFilter.html

truncate

Trunca os termos até um comprimento específico. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/TruncateTokenFilter.html

unique

Filtra tokens com o mesmo texto do token anterior. Veja http://lucene.apache.org/core/4_10_3/analyzers-common/org/apache/lucene/analysis/miscellaneous/RemoveDuplicatesTokenFilter.html

uppercase

Normaliza o texto do token para maiúsculas. Veja https://lucene.apache.org/core/6_6_1/analyzers-common/org/apache/lucene/analysis/core/UpperCaseFilter.html

word_delimiter

Divide palavras em subpalavras e executa transformações opcionais em grupos de subpalavras.