Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Importante
Traduções não ingleses são fornecidas apenas por conveniência. Por favor, consulte a EN-US versão deste documento para a versão definitiva.
O que é uma Nota de Transparência?
Um sistema de IA inclui não só a tecnologia, mas também as pessoas que a irão utilizar, as pessoas que serão afetadas por ela e o ambiente onde é implementada. Criar um sistema adequado ao seu propósito requer compreender como a tecnologia funciona, quais são as suas capacidades e limitações, e como alcançar o melhor desempenho. As Notas de Transparência da Microsoft destinam-se a ajudá-lo a compreender como funciona a nossa tecnologia de IA, as escolhas que os proprietários do sistema podem fazer que influenciam o desempenho e o comportamento do sistema, e a importância de pensar no sistema como um todo, incluindo a tecnologia, as pessoas e o ambiente. Pode usar as Notas de Transparência ao desenvolver ou implementar o seu próprio sistema ou partilhá-las com as pessoas que irão usar ou ser afetadas pelo seu sistema.
As Notas de Transparência da Microsoft fazem parte de um esforço mais amplo da Microsoft para pôr em prática os nossos Princípios de IA. Para saber mais, consulte os princípios Microsoft IA.
Os fundamentos do Pesquisa de IA do Azure
Introdução
O Pesquisa de IA do Azure oferece aos programadores ferramentas, APIs e SDKs para construir uma experiência de pesquisa rica sobre conteúdos privados e heterogéneos em aplicações web, móveis e empresariais. A pesquisa é fundamental para qualquer aplicação que mostre dados aos utilizadores. Cenários comuns incluem pesquisa por catálogo ou documentos, lojas online ou exploração de dados sobre conteúdos proprietários.
Os dados pesquisáveis podem ser sob a forma de texto ou vetores e ingeridos as-is de uma fonte de dados ou enriquecidos através de IA para melhorar a experiência global de pesquisa. Os programadores podem converter dados int em representações numéricas (chamadas vetores), optando por chamar modelos externos de aprendizagem automática (conhecidos como modelos de embedding). Os indexadores podem, opcionalmente, incluir conjuntos de competências que suportem um poderoso conjunto de enriquecimento de dados através de várias capacidades do Azure Language em Foundry Tools, como Reconhecimento de Entidades Nomeadas (NER) e deteção de informação pessoal identificável (PII), e capacidades do Azure Vision em Foundry Tools, incluindo Reconhecimento Óptico de Caracteres (OCR) e análise de imagem.
Veja as abas a seguir para mais informações sobre como o Pesquisa de IA do Azure melhora a experiência de busca através do uso das Ferramentas Foundry ou outros sistemas de IA, para entender melhor a intenção, semântica e estrutura implícita do conteúdo do cliente.
- Enriquecimento de IA
- Pesquisa vetorial
- Classificador semântico
- Reescrita de consultas
- Habilidade de Prompt GenAI
- Recuperação agentica
O enriquecimento de IA é a aplicação de modelos de aprendizagem automática da Foundry Tools sobre conteúdos que não são facilmente pesquisáveis na sua forma bruta. Através do enriquecimento, a análise e a inferência são usadas para criar conteúdo pesquisável e estrutura onde antes não existia.
O enriquecimento de IA é uma extensão opcional da pipeline de indexação do serviço Pesquisa de IA do Azure, que se liga ao Foundry Tools na mesma região do serviço de pesquisa do cliente. Um pipeline de enriquecimento tem os mesmos componentes centrais de um indexador típico (indexador, fonte de dados, índice), além de um conjunto de habilidades que especifica as etapas de enriquecimento atómico. Um conjunto de competências pode ser construído usando competências incorporadas baseadas nas APIs das Foundry Tools, como Visão e Linguagem, ou competências personalizadas que executam código externo que fornece.
A pesquisa vetorial é um método de recuperação de informação onde documentos e consultas são representados num índice como vetores em vez de texto simples. Na pesquisa vetorial, modelos de aprendizagem automática, alojados externamente a partir do Pesquisa de IA do Azure, geram as representações vetoriais das entradas de origem, que podem ser texto, imagens, áudio ou conteúdos de vídeo. Esta representação matemática e normalizada de conteúdo, chamada incorporações vetoriais, fornece uma base comum para cenários de pesquisa.
Quando tudo é um vetor, uma consulta pode encontrar uma correspondência no espaço vetorial, mesmo que o conteúdo original associado esteja num tipo de media diferente, como imagens versus texto, ou linguagem da consulta. O motor de busca analisa o índice à procura de conteúdo vetorial que seja mais semelhante, ou seja, o mais próximo do vetor da consulta. A correspondência numa representação vetorial matemática em vez de palavras-chave torna muito mais provável encontrar correspondências que partilham significado semântico mas são textualmente distintas, como "carro" e "auto", por exemplo. Isto dá uma introdução mais detalhada aos embeddings vetoriais e ao funcionamento do algoritmo de similaridade.
Termos-chave
| Termo | Definição |
|---|---|
| Embeddings vetoriais | Uma forma altamente otimizada de representar dados que refletem significado e compreensão extraídos por um modelo de aprendizagem automática a partir de imagens, áudio, vídeo ou texto. O conteúdo é convertido em embeddings vetoriais tanto na indexação como no momento da consulta. A pesquisa vetorial consiste em utilizar os embeddings fornecidos numa consulta e buscar no índice os embeddings mais semelhantes. Os resultados são então normalmente ordenados pelo grau de similaridade. |
| Espaço de incorporação | Todos os vetores no corpus para um único campo ocupam o mesmo espaço de imersão onde itens semelhantes estão localizados próximos uns dos outros, e itens diferentes estão mais distantes entre si. Uma maior dimensionalidade do espaço de embedding pode incluir mais informação num único vetor e melhorar significativamente a experiência de pesquisa, mas a um custo significativo do tamanho de armazenamento do índice e maior latência de consulta. |
O ranker semântico usa o contexto ou significado semântico de uma consulta para calcular uma nova pontuação de relevância que promove resultados que são semanticamente mais próximos da intenção da consulta original para o topo. O conjunto inicial de resultados pode vir de uma pesquisa por palavras-chave com ranking BM25 , pesquisa vetorial ou uma pesquisa híbrida que inclui ambas. Também cria e devolve "subtítulos", extraindo literalmente conteúdo encontrado no resultado, e "destaques" para chamar a atenção para conteúdos importantes no resultado. Também pode devolver uma "resposta" se a consulta tiver as características de uma pergunta ("qual é o ponto de congelação da água") e o resultado contiver texto com as características de uma resposta ("a água congela a 0°C ou 32°F").
Termos-chave
| Termo | Definição |
|---|---|
| Classificador semântico | Utiliza o contexto e o significado semântico de uma consulta para melhorar a relevância na pesquisa, utilizando o conhecimento da linguagem para reordenar resultados de pesquisa. |
| Legendas semânticas e destaques | Extrai frases e expressões de um documento que melhor resumem o conteúdo, com destaques sobre passagens-chave para facilitar a leitura. Legendas que resumem um resultado são úteis quando os campos de conteúdo individuais são demasiado densos para a página de resultados. O texto destacado eleva os termos e expressões mais relevantes para que os utilizadores possam rapidamente determinar porque é que uma correspondência foi considerada relevante. |
| Respostas semânticas | Fornece uma subestrutura opcional e adicional devolvida a partir de uma consulta semântica. Fornece uma resposta direta a uma consulta que parece uma pergunta. Exige que um documento tenha texto com as características de uma resposta. |
A reescrita de consultas cria consultas sintéticas, que são consultas artificialmente criadas ou geradas a partir de entradas reais do cliente para melhorar a recordação (a fração de documentos relevantes recuperados do total de documentos disponíveis) do ranking BM25, pesquisa vetorial ou uma pesquisa híbrida. A consulta original é combinada com as consultas sintéticas para proporcionar uma recordação ótima do motor de busca.
A competência GenAI Prompt faz parte do catálogo de competências do Pesquisa de IA do Azure, permitindo aos clientes melhorar os seus índices de pesquisa com conteúdos gerados por IA com base nos seus dados. Ao utilizar os próprios dados e preferências da organização do cliente, esta competência ajuda a produzir resumos, respostas ou insights personalizados que se alinham com as suas necessidades específicas.
Isto significa que, quando o utilizador final pesquisa o conteúdo dos clientes através do AI Search, o conteúdo gerado por IA pode fornecer resultados mais informativos e conscientes do contexto, facilitando aos utilizadores a procura da informação que procuram.
Termos-chave
| Termo | Definição |
|---|---|
| Competências | Uma competência do Pesquisa de IA do Azure é um componente modular de processamento dentro do pipeline de enriquecimento do Pesquisa de IA do Azure. Estas competências aplicam transformações impulsionadas por IA em conteúdos brutos — como texto, imagens ou documentos — durante a indexação, permitindo a extração de informação estruturada e pesquisável a partir de dados não estruturados. |
| Enunciado | A mensagem que envias ao serviço na chamada API. Este texto é então introduzido no modelo. Por exemplo, pode-se introduzir o seguinte prompt: Converta as perguntas num comando: P: Pergunta à Constance se precisamos de pão A: enviar mensagem find constance Precisamos de pão? P: Envie uma mensagem ao Greg para saber se está tudo pronto para quarta-feira. R: Enviar-mensagem find greg pronta para quarta-feira? |
| Índices de Pesquisa | No Pesquisa de IA do Azure, um índice é a estrutura de dados que guarda o seu conteúdo pesquisável, define como é armazenado e controla como o serviço o interpretará quando executa uma consulta. |
A recuperação agential é uma arquitetura paralela de processamento de consultas que utiliza um grande modelo de linguagem conversacional (LLM) como um "planeador de consultas". O LLM transforma o histórico de conversas de um utilizador numa ou várias subconsultas focadas, conforme necessário. Estas subconsultas executam-se simultaneamente no seu índice do Pesquisa de IA do Azure, e o serviço funde os resultados principais, devolvendo:
- Uma única cadeia de conteúdo que contém as passagens mais relevantes (dados fundamentais).
- Um array de referências (opcional) que expõe os documentos ou blocos de origem completos.
- Um array de atividades que lista todas as operações, contagem de tokens e latência para ajudar a monitorizar custos e a efetuar a depuração.
Termos-chave
| Termo | Definição |
|---|---|
| Recuperação agêntica | Um agente de IA planeia e executa uma sequência de etapas para recuperar informação de fontes fundamentais. Isto envolve atividades como consultar e refinar pesquisas para obter a informação mais relevante para a consulta. |
| Dados Fundamentais | Conjunto de documentos/informações devolvidos pela Recuperação Agente. Serve como base factual que um LLM externo pode citar ou transformar numa resposta em linguagem natural, garantindo rastreabilidade e reduzindo o risco de alucinações. |
| Planeador de consultas | Decompõe o histórico conversacional em subconsultas para encontrar os dados de base mais relevantes para a pesquisa subjacente. |
| Subconsulta | Uma única consulta gerada por um LLM. As subconsultas baseiam-se nas perguntas dos utilizadores, histórico de chat e parâmetros do pedido. As subconsultas direcionam-se aos seus documentos indexados (texto simples e vetores) no Pesquisa de IA do Azure. |
Capacidades
- Enriquecimento de IA
- Pesquisa vetorial
- Classificador semântico
- Reescrita de consultas
- Habilidade de Prompt GenAI
- Recuperação agentica
Comportamento do sistema
Várias competências incorporadas para enriquecimento de IA em Pesquisa de IA do Azure tiram partido das Ferramentas de Fundição. Consulte as Notas de Transparência para cada competência incorporada abaixo para considerações ao escolher usar uma competência:
- Extração de Frases-Chave: Idioma - Extração de Frases-Chave
- Competência de Deteção de Linguagem: Língua - Deteção de Linguagem
- Habilidade de Ligação de Entidades: Linguagem - Ligação de Entidades
- Habilidade de Reconhecimento de Entidades: Linguagem - Reconhecimento de Entidades Nomeadas (NER)
- Competência de Deteção de PII: Linguagem - Deteção de PII
- Competência de Sentimento: Linguagem - Análise de Sentimento
- Competência de Análise de Imagem: Visão - Análise de Imagem
- Habilidade OCR: Visão - OCR
- Competência de Disposição de Documentos: Inteligência Documental
Consulte a documentação de cada competência para saber mais sobre as respetivas capacidades, limitações, desempenho, avaliações e métodos de integração e uso responsável. Note-se que usar estas habilidades em combinação pode levar a efeitos cumulativos (por exemplo, erros que ocorrem ao utilizar OCR persistirão ao proceder à extração de termos-chave).
Casos de uso
Exemplos de casos de uso
Como o Pesquisa de IA do Azure é uma solução de pesquisa em texto completo, o objetivo do enriquecimento por IA é melhorar a utilidade de pesquisa de conteúdos não estruturados. Aqui estão alguns exemplos de cenários de enriquecimento de conteúdo suportados pelas competências incorporadas:
- A tradução e a deteção de línguas permitem pesquisa multilíngue.
- O reconhecimento de entidades extrai pessoas , lugares e outras entidades de grandes blocos de texto.
- A extração de palavras-chave identifica e depois produz termos importantes.
- O OCR reconhece texto impresso e manuscrito em ficheiros binários.
- A análise de imagens descreve o conteúdo da imagem e apresenta as descrições como campos de texto pesquisáveis.
- Vetorização Integrada é uma funcionalidade de pré-visualização que chama o modelo de embeddings Azure OpenAI para vetorizar dados e armazenar embeddings em Pesquisa de IA do Azure para pesquisa por similaridade.
Comportamento do sistema
Na pesquisa vetorial, o motor de busca procura vetores dentro do espaço de embedding no índice para encontrar aqueles próximos do vetor de consulta. Esta técnica chama-se pesquisa por vizinhos mais próximos. Isto também ajuda a quantificar o grau de semelhança, ou distância, entre os itens. Um elevado grau de similaridade vetorial indica que os dados originais também eram semelhantes. Os dois algoritmos de pesquisa vetorial suportados pelo Pesquisa de IA do Azure têm abordagens diferentes para este problema, alternando características distintas como latência, rendimento, recordação e memória.
Encontrar o verdadeiro conjunto de "k" vizinhos mais próximos requer comparar exaustivamente o vetor de entrada com todos os vetores do conjunto de dados. Embora cada cálculo de similaridade vetorial seja relativamente rápido, realizar estas comparações exaustivas em grandes conjuntos de dados é computacionalmente dispendioso e lento devido ao enorme número de comparações necessárias. Além disso, quanto maior a dimensionalidade de cada vetor, mais complexos e lentos serão os cálculos sobre cada vetor.
Para resolver este desafio, são usados métodos de pesquisa de vizinhos aproximados (ANN) para trocar o recall pela velocidade. Estes métodos conseguem encontrar eficientemente um pequeno conjunto de vetores candidatos que são mais propensos a ser semelhantes ao vetor de consulta, reduzindo o número total de comparações vetoriais. O Pesquisa de IA do Azure utiliza o algoritmo Hierarchical Navigable Small World (HNSW) para organizar pontos de dados de alta dimensão numa estrutura probabilística de grafos hierárquicos que permite uma pesquisa rápida por similaridade, ao mesmo tempo que possibilita um equilíbrio ajustável entre a precisão da pesquisa e o custo computacional.
O Pesquisa de IA do Azure também suporta múltiplas métricas de similaridade para determinar o vizinho mais próximo e a pontuação de cada resultado vetorial. Estas incluem cosseno, "euclidiano" (também conhecido como "norma l2") e "produto escalar". O cosseno calcula o ângulo entre dois vetores. Euclidiana calcula a distância euclidiana entre dois vetores, que é a norma l2 da diferença entre os dois vetores. O produto escalar é afetado pelas magnitudes de ambos os vetores e pelo ângulo entre eles. Para espaços de imersão normalizados, o produto escalar é equivalente à similaridade cosseno, mas é mais eficiente.
Casos de uso
Exemplos de casos de uso
Existem muitos cenários em que a pesquisa vetorial é útil, limitada apenas pelas capacidades do modelo usado para gerar embeddings vetoriais. Aqui estão alguns casos de uso gerais onde a pesquisa vetorial pode ser utilizada:
- Pesquisa semântica: Extrair compreensão semântica do texto usando modelos, como os modelos de embeddings do Azure OpenAI Service.
- Pesquise entre diferentes tipos de dados (multimodais): codifique conteúdos provenientes de imagens, texto, áudio e vídeo, ou uma mistura, e faça uma única pesquisa em todos eles.
- Pesquisa multilíngue: Use um modelo de embeddings multilíngue para representar o seu documento em várias línguas e encontrar resultados nas línguas suportadas.
- Pesquisa híbrida: A pesquisa vetorial é implementada ao nível do campo, o que significa que pode construir consultas que incluam campos vetoriais e campos de texto pesquisáveis. As consultas executam-se em paralelo e os resultados são fundidos numa única resposta. Resultados de pesquisa híbridos com classificação semântica demonstraram proporcionar os melhores resultados qualitativos.
- Pesquisa vetorial filtrada: Uma consulta pode incluir uma consulta vetorial e uma expressão de filtro. Filtros aplicados a outros tipos de dados são úteis para incluir ou excluir documentos com base noutros critérios.
- Base de dados vetorial: Este armazenamento vetorial puro destina-se à memória de longo prazo ou a uma base de conhecimento externa para Grandes Modelos de Linguagem (LLMs). Por exemplo, use o Pesquisa de IA do Azure como um índice vetorial no fluxo de prompts do Azure Machine Learning para aplicações de Geração Aumentada de Recuperação (RAG).
Considerações na escolha de um caso de uso
Podem existir considerações e preocupações associadas ao modelo específico que escolher para gerar embeddings vetoriais. Cada modelo pode ter os seus próprios problemas de viés e equidade e deve ser avaliado antes de ser utilizado na sua aplicação. O Pesquisa de IA do Azure não fornece quaisquer modelos para vetorizar conteúdos como parte do serviço. Consulte a Nota de Transparência Azure OpenAI Service para exemplos destas considerações. Outros modelos de terceiros ou software open-source (OSS) têm considerações próprias a serem revistas.
Comportamento do sistema
Classificar os resultados da etapa de recuperação de primeira camada é um processo altamente intensivo em recursos. Para completar o processamento do ranker dentro da latência esperada de uma operação de consulta, apenas os 50 melhores resultados do motor de recuperação são enviados ao ranker semântico como entradas. Se for demasiado longo, os 50 resultados são primeiro enviados para uma etapa de sumarização que extrai o conteúdo mais relevante de cada resultado antes de executar o ranker semântico.
Na etapa de sumar, o documento recuperado é primeiro submetido a um processo de preparação que concatena as diferentes entradas do documento numa única cadeia longa. Se a cadeia for demasiado longa, realiza-se um exercício de corte, com especial ênfase na retenção do conteúdo contido nos campos adicionados à configuração semântica. Depois de as cadeias de texto serem preparadas, são passadas por modelos de compreensão automática de leitura e representação de linguagem para determinar quais frases e expressões fornecem o melhor resumo em relação à questão. Esta fase extrai conteúdo da cadeia que será passado para a etapa semântica de classificação e, opcionalmente, produz uma legenda semântica ou uma resposta semântica.
A etapa final, a classificação semântica, determina a relevância do conteúdo extraído na etapa anterior à consulta do utilizador e produz uma pontuação semântica de classificação que varia de 4 (altamente relevante) a 0 (irrelevante). Esta etapa baseia-se no texto da consulta e no texto resumido e envolve cálculos mais complexos do que os da camada de recuperação.
Casos de uso
Exemplos de casos de uso
O ranker semântico pode ser usado em vários cenários. Os casos de uso pretendidos do sistema incluem:
- Geração Aumentada de Recuperação (RAG): O ranking semântico permite-lhe fundamentar respostas das suas aplicações de IA generativa em resultados de pesquisa relevantes que cumpram o limiar de pontuação de relevância que define. Por exemplo, o Azure OpenAI Service nos seus dados utiliza o Pesquisa de IA do Azure para complementar os modelos Azure OpenAI com os seus dados. Pode usar o ranker semântico dentro deste serviço para melhorar a relevância da informação fornecida ao modelo Azure OpenAI.
- Pesquisa de conteúdo: O ranking semântico permite-lhe pesquisar conteúdos relevantes nos seus dados analisando texto e metadados. Por exemplo, a pesquisa no site learn.microsoft.com utiliza um ranking semântico para melhorar a relevância da pesquisa para programadores de software que procuram documentação técnica da Microsoft.
- Pesquisa de comércio eletrónico: O ranking semântico permite às empresas de comércio eletrónico melhorar a sua experiência de pesquisa ao fornecer resultados relevantes de produtos baseados na relevância semântica. Por exemplo, os retalhistas online utilizam o ranking semântico para otimizar a sua experiência no comércio eletrónico, fornecendo resultados de pesquisa relevantes para os seus compradores online.
- QnA: Pesquisa de IA do Azure permite às organizações proporcionar uma experiência conversacional aos seus utilizadores, respondendo a perguntas com base na informação disponível nas suas bases de dados. Por exemplo, um fabricante pode usar o ranker semântico para aumentar a informação disponível para um chatbot. Os engenheiros podem usar este chatbot para colocar perguntas e recuperar documentos internos altamente relevantes relacionados com as suas dúvidas e respostas instantâneas dentro dos documentos recuperados.
Considerações na escolha de um caso de uso
Incentivamos os clientes a utilizarem o ranking semântico nas suas soluções ou aplicações inovadoras. No entanto, aqui estão algumas considerações ao escolher um caso de uso:
- Informação sensível : Os modelos de aprendizagem automática que permitem o ranker semântico processam os dados recuperados numa consulta de pesquisa, incluindo informações sensíveis como dados pessoais e financeiros. Considere quaisquer implicações de privacidade e segurança antes de implementar o ranker semântico para esses casos de uso.
- Viés e justiça : O ranking semântico é alimentado por modelos de deep learning. Estes modelos de aprendizagem profunda foram treinados utilizando conteúdos públicos. Os dados dos clientes são avaliados pelos modelos semânticos de classificação. Avalie a saída do ranking semântico ao selecionar casos de uso, especialmente para casos que têm implicações para a justiça e equidade, como contratação e recrutamento.
- Cumprimento da regulamentação: Algumas indústrias, como a da saúde e das finanças, são altamente reguladas e podem ter restrições quanto ao uso de IA e aprendizagem automática. Antes de usar o ranking semântico nestas indústrias, certifique-se de que a solução cumpre as regulamentações e diretrizes relevantes.
Comportamento do sistema
A consulta original é enviada para um Modelo de Linguagem Pequeno (SLM)
As consultas sintéticas são então combinadas com a consulta original e enviadas para o motor de busca. Quando realiza o ranking BM25, termos-chave das consultas sintéticas são combinados com a consulta original. Quando realiza pesquisa vetorial, a consulta original é concatenada com as consultas sintéticas antes do passo de incorporação vetorial .
Casos de uso
Exemplos de casos de uso
A reescrita de consultas pode ser usada em múltiplos cenários. A reescrita de consultas requer o uso de um ranqueador semântico.
- Interação por chat com os seus dados: A reescrita de consultas permite-lhe fundamentar as respostas das suas aplicações de IA generativa em resultados de pesquisa relevantes que cumpram o limiar de pontuação de relevância que define. Por exemplo, o Azure OpenAI Service On Your Data utiliza o Pesquisa de IA do Azure para complementar modelos Azure OpenAI com os seus dados. Pode usar a reescrita de consultas dentro deste serviço para melhorar a relevância dos resultados da informação fornecida ao modelo Azure OpenAI.
- Perguntas e Respostas Conversacionais (QnA): Pesquisa de IA do Azure permite às organizações proporcionar uma experiência conversacional aos seus utilizadores, respondendo a perguntas com base na informação disponível nas suas bases de dados. Por exemplo, um fabricante pode usar o ranker semântico para aumentar a informação disponível para um chatbot. Os engenheiros podem usar este chatbot para colocar perguntas e recuperar documentos internos altamente relevantes relacionados com as suas dúvidas e respostas instantâneas dentro dos documentos recuperados.
Considerações na escolha de um caso de uso
Incentivamos os clientes a utilizar a reescrita de consultas nas suas soluções ou aplicações inovadoras. No entanto, aqui estão algumas considerações ao escolher um caso de uso:
- Informação sensível e PII: O SLM finamente ajustado — que permite a reescrita de consultas — processa a consulta de pesquisa, que pode conter informações sensíveis. Considere quaisquer implicações de privacidade e segurança antes de implementar a reescrita de consultas para esses casos de uso.
- Rediga informações pessoais para reduzir o viés inconsciente. Por exemplo, durante o processo de revisão do currículo de uma empresa, podem querer bloquear o nome, morada ou número de telefone de um candidato para ajudar a reduzir preconceitos inconscientes de género ou outros durante a pesquisa.
- Considerações legais e regulatórias. As organizações precisam de avaliar potenciais obrigações legais e regulatórias específicas ao utilizar qualquer Pesquisa por IA, que pode não ser adequada para uso em todas as indústrias ou cenários. As restrições podem variar consoante os requisitos regulamentares regionais ou locais. Além disso, a Pesquisa por IA não foi concebida e não pode ser usada de formas proibidas nos termos de serviço aplicáveis e nos códigos de conduta relevantes.
A competência GenAI Prompt permite aos clientes passar o conteúdo do seu documento, existente nas suas fontes de dados e prompts personalizados, para um modelo de linguagem que possuem, alojado no Microsoft Foundry. O modelo de linguagem processa a entrada e devolve o conteúdo enriquecido, que é então ingerido no índice de pesquisa juntamente com o conteúdo original do documento. Este processo permite a ampliação dos índices de pesquisa com resumos gerados por IA, legendas de imagens e extração de entidades, entre outros, com base em critérios definidos pelo cliente.
Os exemplos seguintes mostram como funciona a habilidade GenAI Prompt.
Resumo do bilhete zero-shot
Objetivo: Permitir que os agentes de suporte vejam tópicos de email de várias páginas em segundos.
Como funciona:
- Durante a indexação, cada conversa de chamado longo é dividida em segmentos lógicos (pedido inicial, perguntas de acompanhamento, registos de diagnóstico, etc.).
- Para cada segmento, o modelo de linguagem é instruído a "resumir esta secção em três frases concisas."
- Os resumos resultantes substituem o texto bruto durante a recuperação, pelo que os agentes — e os pipelines RAG a jusante — veem apenas a essência destilada.
Porque é que ajuda: Resumos concisos ao nível de segmentos reduzem o tamanho dos prompts, aceleram a geração de respostas e ajudam os agentes a focar-se no problema central do cliente.
Extração de entidades com poucos exemplos
Objetivo: Suportar consultas como "Mostre-me todos os tickets onde o Produto X crashou com erro 500."
Como funciona
- O texto completo do ticket é enviado para a competência juntamente com um exemplo trabalhado que mostra o formato de saída desejado (uma lista de entidades-chave como nome do produto, código de erro, sistema operativo e gravidade).
- O modelo extrai todas as ocorrências de 〈produto, error_code, plataforma, gravidade.
- Esta lista estruturada é armazenada com o documento, permitindo filtros instantâneos que, por exemplo, revelam todas as falhas de alta gravidade no iOS.
Porque ajuda: Entidades pré-calculadas transformam mensagens livres de clientes em dados filtráveis, permitindo que os responsáveis de suporte identifiquem padrões e priorizem correções sem necessidade de análise manual.
Classificação de Roteamento de Tickets One-shot
Objetivo: Encaminhar automaticamente cada bilhete para a fila correta.
Como funciona:
- Cada ticket é analisado com um prompt que lista cinco categorias de suporte — Faturação, Problema Técnico, Acesso à Conta, Pedido de Funcionalidade e Feedback Geral — além de um exemplo de referência ("Exemplo de Ticket → Faturação").
- O modelo atribui exatamente uma etiqueta, baseada nas cinco categorias de suporte acima, a cada ticket que entra no sistema de Pesquisa por IA como entrada.
- O sistema de help desk usa a etiqueta para enviar consultas de faturação a especialistas financeiros, falhas técnicas para engenheiros, e assim por diante.
Porque ajuda: Uma rotulagem rápida e consistente reduz tickets roteados incorretamente, reduz o tempo de resolução e melhora a satisfação do cliente.
Sugestão de resolução por cadeia de pensamento
Objetivo: Proporcionar aos agentes de apoio o melhor passo seguinte para resolver o problema.
Como funciona
- O ticket completo — ou a sua mensagem mais recente ao cliente — é passado para o modelo de linguagem.
- A mensagem do utilizador instrui o modelo após o prompt do sistema: "Pense passo a passo internamente, mas produza apenas a próxima ação recomendada."
- A orientação devolvida pode ser: "Peça ao cliente para limpar a cache e reinstalar a versão 3.2.1."
- Os agentes podem copiar a sugestão diretamente ou aperfeiçoá-la antes de responder.
Porque ajuda: Os agentes recebem uma recomendação acionável sem a cadeia de raciocínio privada do modelo, poupando tempo enquanto mantêm os passos de resolução de problemas concisos e relevantes. Em certos casos, o agente de apoio não está inundado com informações desnecessárias.
Casos de uso
Exemplos de casos de uso
A funcionalidade de Prompt GenAI aperfeiçoa o enriquecimento de dados dentro do Pesquisa de IA do Azure, ajudando a melhorar a relevância das respostas para alinhar com a intenção e as expectativas do utilizador. Ao integrar conteúdos gerados por IA nos índices de pesquisa, esta competência permite resultados de pesquisa mais precisos e contextualmente adequados. As principais aplicações incluem:
- Gerar resumos concisos de documentos extensos para facilitar uma recuperação mais rápida de informação: Um escritório de advogados processa contratos extensos e utiliza a competência GenAI Prompt para criar resumos breves que destacam cláusulas-chave, facilitando aos advogados a revisão de informações essenciais sem lerem documentos completos.
- Criar descrições textuais para imagens para melhorar a pesquisa e acessibilidade: Uma empresa de media gere uma vasta biblioteca de imagens. Ao aplicar a competência GenAI Prompt, geram legendas descritivas para cada imagem, permitindo uma pesquisa e organização eficientes dentro do seu sistema de gestão de ativos digitais.
- Identificar e extrair entidades ou factos específicos de documentos com base em critérios personalizados: Uma instituição de investigação analisa artigos científicos para extrair menções a compostos químicos e às suas propriedades. A competência GenAI Prompt automatiza esta extração, preenchendo uma base de dados estruturada para que os investigadores possam aceder rapidamente aos dados relevantes.
- Classificação de documentos em categorias definidas para melhor organização e recuperação: Uma companhia de seguros recebe diariamente vários tipos de documentos. Utilizando a ferramenta GenAI Prompt, classificam automaticamente estes documentos em categorias como Sinistros, Atualizações da Apólice e Comentários de Clientes. Isto simplifica o processo de gestão documental e facilita a localização de documentos específicos quando necessário.
Embora estas sejam aplicações comuns, a competência é flexível, permitindo aos clientes definir prompts adaptados às suas necessidades únicas.
Considerações na escolha de um caso de uso
É importante notar que o conteúdo, os prompts e as implementações dos modelos de linguagem são recursos totalmente geridos pelo cliente. A Foundry suporta filtros de segurança de conteúdo para implementações de modelos, e os clientes são responsáveis por configurar estes filtros conforme necessário. Para além das configurações disponíveis no Foundry, o Pesquisa de IA do Azure não aplica filtros adicionais de segurança de conteúdo dentro da competência GenAI Prompt.
Ao implementar a competência GenAI Prompt, considere o seguinte:
- Implementar processos para revisão humana de conteúdos gerados por IA, especialmente ao aplicar transformações de prompts que possam afetar a fiabilidade da informação. Utilize a ferramenta debug sessions da Pesquisa de IA do Azure para testar prompts em documentos de exemplo antes da implementação em larga escala.
- Evite cenários em que o uso ou indevido do sistema possa resultar em lesões físicas ou psicológicas significativas a um indivíduo. Por exemplo, cenários que diagnosticam pacientes ou prescrevem medicamentos têm potencial para causar danos significativos. Incorporar uma revisão e supervisão humana significativa no cenário pode ajudar a reduzir o risco de consequências prejudiciais.
- Considere cuidadosamente todos os casos de uso generativo. Cenários de geração de conteúdo podem ser mais propensos a produzir resultados não intencionais e estes cenários exigem consideração cuidadosa e mitigações.
- Considerações legais e regulatórias. As organizações precisam de avaliar potenciais obrigações legais e regulatórias específicas ao utilizar qualquer Pesquisa por IA, que pode não ser adequada para uso em todas as indústrias ou cenários. As restrições podem variar consoante os requisitos regulamentares regionais ou locais. Além disso, a Pesquisa por IA não foi concebida e não pode ser usada de formas proibidas nos termos de serviço aplicáveis e nos códigos de conduta relevantes.
Comportamento do sistema
A conversa original ou consulta de pesquisa é enviada para o modelo Azure OpenAI, propriedade do cliente, para executar os passos de planeamento da consulta. O planeamento de consultas divide a conversa numa série de subconsultas otimizadas que refletem a intenção subjacente do utilizador com ortografia corrigida e sinónimos expandidos. O Pesquisa de IA do Azure processa então todas as subconsultas de uma só vez em todo o sistema de recuperação de pesquisa. As subconsultas são inicialmente processadas por uma combinação híbrida de pesquisa por palavras-chave e pesquisa vetorial. A pesquisa por palavras-chave encontra os documentos no índice de pesquisa com palavras-chave semelhantes às subconsultas. A pesquisa vetorial encontra documentos no índice de pesquisa que podem ter palavras-chave diferentes, mas significado subjacente semelhante às subconsultas. Os resultados desta pesquisa híbrida são então reclassificados por ranking semântico para encontrar os documentos com a melhor correspondência à intenção da subconsulta. O serviço então combina e remove duplicados dos resultados classificados, aplicando limites de resposta, como o comprimento máximo da resposta, antes de enviar de volta a resposta final.
Casos de uso
Exemplos de casos de uso
- Base de dados para chatbots personalizados. Ligue o chatbot às políticas oficiais de RH da empresa e ao manual do funcionário para que, quando alguém perguntar, "Quantos dias de férias tenho?", o chatbot retire a resposta diretamente desses documentos em vez de adivinhar.
- Equipar os assistentes de conhecimento empresarial para respeitarem o contexto do utilizador, os filtros e o histórico de conversas. Por exemplo, quando um colaborador pergunta sobre os objetivos para um período específico, o assistente usa o seu papel, os filtros atuais (por exemplo, região: EUA) e a conversa em curso (por exemplo, o último tema foi "Pipeline do segundo trimestre") para gerar uma resposta personalizada.
- Aborde tarefas complexas de procura de informação onde uma única consulta por palavra-chave tem pouca recordação. Tais tarefas podem incluir guias de resolução de problemas, investigação em literatura médica ou comparações de produtos. Por exemplo, se um técnico simplesmente pesquisar "erro do dispositivo" e receber resultados genéricos, um recuperador inteligente pode considerar todo o histórico da conversa, que pode incluir modelo do dispositivo, versão do software, histórico de manutenção e estado da rede para apresentar artigos precisos e relevantes.
- Garantir total transparência sobre o que foi recuperado, porquê e a que custo. Por exemplo, ao resumir documentos regulatórios e conclusões de auditorias anteriores, é fundamental conhecer as fontes exatas (por exemplo, "apresentação da SEC do segundo trimestre de 2023"), a justificação da seleção (por exemplo, "palavras-chave emparelhadas: divulgação de risco, derivados") e os custos associados (por exemplo, utilização de tokens).
Considerações na escolha de um caso de uso
- Latência: Adicionar uma segunda chamada de LLM para planeamento de consultas prolonga inevitavelmente o tempo de ida e volta do pedido. Mesmo com modelos rápidos, deve avaliar o atraso extra durante o tráfego de pico e verificar se a experiência global continua aceitável para os seus utilizadores. Quando a latência é crítica, considere armazenar em cache consultas frequentes ou usar modelos de planeamento mais pequenos e rápidos.
- Custo: As taxas acumulam-se em duas dimensões — tokens de modelo OpenAI e tokens de classificação de resultados de pesquisa. A chamada query-planner é faturada pelo Azure OpenAI tanto para os tokens de entrada quanto para os de saída, enquanto cada subconsulta é faturada pelo Pesquisa de IA do Azure pelos tokens que deve classificar. Os tokens de classificação são gratuitos na fase inicial da pré-visualização pública. Estima antecipadamente os números de tokens do modelo e de ranking para a tua carga de trabalho.
- Entradas sensíveis: Todo o histórico de conversas é encaminhado para o modelo do planeador, o que significa que quaisquer dados pessoalmente identificáveis ou sensíveis ao negócio saem do seu limite imediato de confiança. Remova, mascare ou rediga esses dados antes de invocar o LLM e documente essa mitigação na sua postura de proteção de dados.
- Limites de região e de pré-visualização: A recuperação de agentes só está disponível em regiões onde o ranker semântico está disponível. Um agente individual pode indicar apenas um índice de Pesquisa. Confirme que a região que hospeda os seus dados e modelo suporta a recuperação por agentes, e planeie agentes separados caso precise de abranger vários índices ou geografias.
- Conformidade: Confirme que o uso de um planeador de consultas orientado por LLM cumpre requisitos setoriais ou regionais (por exemplo, residência de dados, privacidade ou regras de decisão automatizada na área da saúde ou finanças). Garantir uma supervisão e controlo humanos adequados. Considere incluir controlos para ajudar os programadores a verificar, rever e/ou aprovar ações de forma atempada, o que pode incluir a revisão de tarefas planeadas ou chamadas para fontes de dados externas.
- Considerações legais e regulatórias: Os utilizadores precisam de avaliar potenciais obrigações legais e regulatórias específicas ao utilizar quaisquer Ferramentas e Soluções da Foundry, que podem não ser adequadas para uso em todas as indústrias ou cenários. Além disso, as ferramentas ou soluções da Foundry não foram concebidas para e não podem ser usadas de formas proibidas nos termos de serviço aplicáveis e nos códigos de conduta relevantes.
Limitações
- Enriquecimento de IA
- Pesquisa vetorial
- Classificador semântico
- Reescrita de consultas
- Habilidade de Prompt GenAI
- Recuperação agentica
O enriquecimento de IA no Pesquisa de IA do Azure utiliza as funcionalidades do indexador e da fonte de dados do serviço para chamar a Foundry Tools para realizar o enriquecimento de conteúdo. Serão aplicadas limitações dos indexadores e fontes de dados utilizadas neste processo. Consulte a documentação do indexador e da fonte de dados para mais informações sobre estas limitações relacionadas. As limitações de cada ferramenta Foundry utilizada pelo pipeline de enriquecimento de IA no Pesquisa de IA do Azure também se aplicarão. Consulte as notas de transparência de cada serviço para mais informações sobre estas limitações.
Limitações técnicas, fatores operacionais e alcances
Todos os vetores carregados para o Pesquisa de IA do Azure devem ser gerados externamente a partir do serviço, utilizando um modelo à sua escolha. É sua responsabilidade considerar as limitações técnicas e os fatores operacionais de cada modelo, e se as incorporações que cria são otimizadas ou sequer apropriadas para o seu caso de uso. Isto inclui tanto as inferências de significado extraídas do conteúdo, como a dimensionalidade do espaço de imersão vetorial.
O modelo de vetorização cria um espaço de embeddings que define a experiência resultante de pesquisa do utilizador final numa aplicação. Podem existir desvantagens num modelo que afeta negativamente tanto a funcionalidade como o desempenho se um modelo não estiver bem alinhado com um caso de uso desejado ou se os embeddings gerados estiverem mal otimizados.
Embora muitas limitações da pesquisa vetorial derivem do modelo usado para gerar embeddings, existem algumas opções adicionais que deve considerar no momento da consulta. Pode escolher entre dois algoritmos para determinar a relevância dos resultados de pesquisa vetorial: Exhaustive k-nearest neighbors (KNN) ou Hierarchical Navigable Small World. Os k-vizinhos mais próximos exaustivos (KNN) efetuam uma busca de força bruta em todo o espaço vetorial para encontrar as correspondências mais semelhantes à consulta, calculando as distâncias entre todos os pares de pontos de dados e identificando exatamente os k-vizinhos mais próximos de um ponto de consulta. Embora mais preciso, este algoritmo pode ser lento. Se a baixa latência for o objetivo principal, considere usar o algoritmo Hierarchical Navigable Small World (HNSW). O HNSW realiza uma pesquisa eficiente aproximada do vizinho mais próximo (ANN) em espaços de imersão de alta dimensão. Consulte a documentação de pesquisa vetorial para mais informações sobre estas opções.
Boas práticas para melhorar o desempenho do sistema
- Dedique tempo a testar a sua aplicação com os diferentes conteúdos e tipos de perguntas que espera que a sua aplicação suporte. Identifique qual a experiência de consulta que melhor se adequa às suas necessidades.
- Dedique tempo a testar os seus modelos com uma gama completa de conteúdos de entrada para perceber como se comportam em muitas situações. Este conteúdo pode incluir inputs potencialmente sensíveis para perceber se existe algum viés inerente ao modelo. A visão geral Azure OpenAI Responsible AI fornece orientações sobre como usar a IA de forma responsável.
- Considera adicionar Segurança de conteúdo de IA do Azure à arquitetura da tua aplicação. Inclui uma API para detetar texto ou imagens gerados por utilizadores e IA prejudiciais em aplicações e serviços.
Avaliar e integrar a pesquisa vetorial para o seu uso
Para garantir um desempenho ótimo, realize as suas próprias avaliações das soluções que pretende implementar utilizando pesquisa vetorial. Siga um processo de avaliação que: (1) utilize alguns intervenientes internos para avaliar os resultados, (2) utilize experimentação A/B para implementar a pesquisa vetorial aos utilizadores, (3) incorpore indicadores-chave de desempenho (KPIs) e monitorização de métricas quando o serviço é implementado em experiências pela primeira vez, e (4) teste e ajuste a configuração semântica do ranker e/ou definição do índice, incluindo as experiências envolventes, como a colocação de interfaces de utilizador ou processos empresariais.
A Microsoft avaliou rigorosamente a pesquisa vetorial tanto em termos de latência como de recordação e relevância, utilizando conjuntos de dados diversos para medir a velocidade, escalabilidade e precisão dos resultados devolvidos. O foco principal dos seus esforços de avaliação deve ser selecionar o modelo adequado para o seu caso de uso específico, compreender as limitações e preconceitos do modelo e testar rigorosamente a experiência de pesquisa vetorial de ponta a ponta.
Limitações técnicas, fatores operacionais e alcances
Podem existir casos em que resultados semânticos, legendas e respostas possam não parecer corretos. Os modelos usados pelo semantic ranker são treinados em várias fontes de dados (incluindo open source e seleções do corpus Microsoft Bing). O ranqueamento semântico suporta uma vasta gama de linguagens e tenta associar as consultas dos utilizadores ao conteúdo dos seus resultados de pesquisa. O ranking semântico é também uma funcionalidade premium com custo adicional, que deve ser considerada ao projetar o custo total da sua solução de ponta a ponta.
O rankeador semântico é mais provável de aumentar a relevância para conteúdos semânticos ricos, como artigos e descrições. Procura contexto e relação entre termos, elevando correspondências que fazem mais sentido em função da consulta. A compreensão de linguagem "encontra" resumos ou legendas e respostas dentro do seu conteúdo, mas ao contrário de modelos generativos como o Azure OpenAI Service GPT-3.5 ou GPT-4, não os cria. Apenas texto literal dos documentos de origem é incluído na resposta, que pode depois ser apresentado numa página de resultados de pesquisa para uma experiência de pesquisa mais produtiva.
Modelos pré-treinados e de última geração são usados para sumarização e classificação. Para manter o desempenho rápido que os utilizadores esperam da pesquisa, a sumarização semântica e a classificação são aplicadas apenas aos 50 primeiros resultados, conforme pontuados pelo algoritmo de pontuação padrão. Os inputs são derivados do conteúdo do resultado da pesquisa. Não consegue voltar ao índice de pesquisa para aceder a outros campos do documento de pesquisa que não foram devolvidos na resposta da consulta. As entradas estão sujeitas a um comprimento de token de 8.960. Estes limites são necessários para manter tempos de resposta em milissegundos.
O algoritmo de pontuação padrão é do Bing e da Microsoft Research e integrado na infraestrutura do Pesquisa de IA do Azure como uma funcionalidade adicional. Os modelos são usados internamente, não são expostos ao desenvolvedor e não são configuráveis. Para mais informações sobre a investigação e os investimentos em IA que apoiam o classificador semântico, veja Como a IA do Bing está a impulsionar a Pesquisa de IA do Azure (Microsoft Research Blog).
Semântic Ranker também oferece respostas, legendas e destaque dentro da resposta. Por exemplo, se o modelo classificar uma consulta como uma pergunta e estiver 70% confiante na resposta, o modelo devolve uma resposta semântica. Além disso, legendas semânticas fornecem o conteúdo mais relevante nos resultados e apresentam um breve excerto que destaca as palavras ou expressões mais relevantes nesse excerto.
Os resultados do ranking semântico baseiam-se nos dados do índice de pesquisa subjacente, e os modelos fornecem classificação de relevância, respostas e legendas com base na informação retirada do índice. Antes de usar o ranker semântico num ambiente de produção, é importante fazer testes adicionais e garantir que o conjunto de dados é preciso e adequado para o caso de uso pretendido. Para mais informações e exemplos de como avaliar o ranking semântico, consulte o conteúdo e o apêndice aqui.
Desempenho do sistema
Em muitos sistemas de IA, o desempenho é frequentemente definido em relação à precisão — ou seja, com que frequência o sistema de IA oferece uma previsão ou resultado correto. Com modelos de linguagem natural em grande escala, dois utilizadores diferentes podem olhar para a mesma saída e ter opiniões diferentes sobre a sua utilidade ou relevância, o que significa que o desempenho destes sistemas deve ser definido de forma mais flexível. Aqui, consideramos de forma geral o desempenho como o facto de a aplicação funcionar como você e os seus utilizadores esperam, incluindo não gerar resultados prejudiciais.
O ranqueador semântico foi treinado em conteúdo público. Como resultado, a relevância semântica varia consoante os documentos no índice e as consultas feitas contra ele. É importante usar o seu próprio julgamento e pesquisa ao utilizar este conteúdo para tomar decisões.
Boas práticas para melhorar o desempenho do sistema
- Dedique tempo a realizar testes A/B na sua aplicação com diferentes tipos de consultas, como palavras-chave versus método híbrido mais classificador semântico. Identifique qual a experiência de consulta que melhor se adequa às suas necessidades.
- Dedique um esforço razoável para configurar a sua configuração semântica de acordo com a documentação de funcionalidades.
- Não confie nas respostas semânticas se não tiver confiança na precisão da informação dentro do índice de pesquisa.
- Nem sempre confie nas legendas semânticas porque são extraídas do conteúdo do cliente através de uma série de modelos que prevêem as respostas mais relevantes num breve excerto.
Avaliação do classificador semântico
Métodos de avaliação
O ranking semântico foi avaliado através de testes internos, incluindo julgamento automatizado e humano sobre múltiplos conjuntos de dados, bem como feedback de clientes internos. Os testes incluem a classificação dos documentos, classificando-os como relevantes ou não relevantes, juntamente com a classificação dos documentos por ordem de prioridade de relevância. Da mesma forma, a funcionalidade de legendas e respostas também foi classificada através de testes internos.
Resultados da avaliação
Esforçamo-nos por entregar todas as atualizações do modelo sem regressão (ou seja, o modelo atualizado deve apenas melhorar o modelo de produção atual). Cada candidato é comparado diretamente com o modelo de produção atual, utilizando métricas adequadas à característica a avaliar (por exemplo, Ganho Cumulativo Normalizado Descontado para classificação e precisão/recordação para respostas). Os modelos semânticos de ranker são treinados, ajustados e avaliados utilizando uma vasta gama de dados de treino que representam documentos com diferentes propriedades (linguagem, comprimento, formatação, estilos e tons) para suportar a maior variedade de cenários de pesquisa. Os nossos dados de treino e testes são retirados de:
Fontes dos documentos:
- Referências académicas e industriais
- Dados do cliente (apenas testes, realizados com permissão do cliente)
- Dados sintéticos
Fontes de consultas:
- Conjuntos de consultas de benchmark
- Conjuntos de consultas fornecidos pelo cliente (apenas testes, realizados com permissão do cliente)
- Conjuntos sintéticos de consultas
- Conjuntos de consultas gerados por humanos
Fontes de rótulos para pontuação de pares de consultas e documentos:
- Rótulos de referência académicos e industriais
- Etiquetas de cliente (apenas testes, realizadas com permissão do cliente)
- Etiquetas de dados sintéticos
- Rótulos com pontuação humana
Avaliar e integrar o ranker semântico para uso próprio
O desempenho do ranker semântico varia consoante os usos reais e as condições em que as pessoas o utilizam. A qualidade da relevância proporcionada pelos modelos de deep learning que alimentam as capacidades semânticas de ranker está diretamente correlacionada com a qualidade dos dados do seu índice de pesquisa. Por exemplo, os modelos atualmente têm limitações de tokens que consideram apenas os 8.960 tokens principais para respostas semânticas. Portanto, se a resposta semântica a uma consulta de pesquisa for encontrada perto do final de um documento longo (para além do limite de 8.960 tokens), a resposta não será fornecida. A mesma regra aplica-se às legendas. Além disso, a configuração semântica lista os campos de pesquisa relevantes por ordem de prioridade. Pode reordenar os campos desta lista para ajudar a adaptar a relevância e adequar-se melhor às suas necessidades.
Para garantir um desempenho ótimo nos seus cenários, os clientes devem realizar as suas próprias avaliações das soluções que implementam, utilizando o ranking semântico. Os clientes devem geralmente seguir um processo de avaliação que: (1) utiliza alguns intervenientes internos para avaliar os resultados, (2) utiliza experimentação A/B para implementar o ranking semântico aos utilizadores, (3) incorpora KPIs e métricas de monitorização quando o serviço é implementado nas experiências pela primeira vez, e (4) testa e ajusta a configuração semântica do ranker e/ou definição do índice, incluindo as experiências envolventes, como a colocação de interfaces de utilizador ou processos empresariais.
Se estiver a desenvolver uma aplicação num domínio ou setor de alto risco, como saúde, recursos humanos, educação ou área jurídica, avalie quão bem a aplicação funciona no seu cenário, implemente uma forte supervisão humana, avalie até que ponto os utilizadores compreendem as limitações da aplicação e cumprem todas as leis relevantes. Considera outras medidas de mitigação consoante o teu cenário.
Limitações técnicas, fatores operacionais e alcances
Podem existir casos em que as consultas sintéticas estejam incorretas, tenham demasiadas restrições ou sejam demasiado caras. A reescrita de consultas suporta uma vasta gama de linguagens e tenta reescrever as consultas dos utilizadores para maximizar a recordação, sendo necessário especificar a linguagem de consulta como entrada. A reescrita de consultas faz parte do Semantic Ranker (funcionalidade do Pesquisa de IA do Azure para melhorar a relevância da pesquisa), que é uma funcionalidade premium com custo adicional. Isto deve ser tido em conta ao projetar os custos globais da sua solução de ponta a ponta. A reescrita de consultas só pode ser usada se tiveres o ranker semântico ativado.
Antes de usar a reescrita de consultas num ambiente de produção (versão ativa da sua aplicação), é importante fazer testes adicionais e garantir que as consultas sintéticas são adequadas ao caso de uso pretendido. Para mais informações e exemplos de como avaliar a reescrita de consultas, consulte o conteúdo e o apêndice aqui.
Desempenho do sistema
Com modelos de linguagem natural em grande escala, dois utilizadores diferentes podem olhar para a mesma saída e ter opiniões diferentes sobre a sua utilidade ou relevância, o que significa que o desempenho destes sistemas deve ser definido de forma mais flexível. Aqui, consideramos de forma geral o desempenho como o facto de a aplicação funcionar como você e os seus utilizadores esperam, incluindo não gerar resultados prejudiciais.
O desempenho da reescrita de consultas varia consoante os usos reais e as condições em que as pessoas a utilizam. A qualidade das consultas sintéticas fornecidas pelo modelo de reescrita de consultas está diretamente correlacionada com a consulta de pesquisa original.
Para garantir um desempenho ótimo nos seus cenários, os clientes devem realizar as suas próprias avaliações das soluções que implementam, utilizando a reescrita de consultas. Os clientes devem geralmente seguir um processo de avaliação que:
- utiliza alguns intervenientes internos para avaliar os resultados,
- usa experimentação A/B para implementar a reescrita de queries aos usuários, e
- incorpora KPIs e métricas de monitorização quando o serviço é implementado em experiências pela primeira vez
Boas práticas para melhorar o desempenho do sistema
- Complete testes A/B para a sua aplicação com diferentes tipos de consultas (texto completo, vetor, híbrido ou outro tipo de consultas). Identifique qual a experiência de consulta que melhor se adequa às suas necessidades.
- Nem sempre assuma que cada consulta sintética gerada pela reescrita refletirá a intenção exata da consulta original. As consultas sintéticas são geradas por um SLM finamente ajustado, que gera consultas semanticamente semelhantes à intenção da consulta original, mas que podem não corresponder exatamente à intenção.
Avaliação da reescrita de consultas
Métodos de avaliação
A reescrita de consultas foi avaliada através de testes internos, incluindo avaliação automática e humana em vários conjuntos de dados, bem como feedback de clientes internos. Os testes incluíram a avaliação da relevância dos resultados da classificação semântica combinada com a reescrita das consultas em comparação com a relevância dos resultados apenas com a classificação semântica.
Resultados da avaliação
Cada modelo candidato é comparado diretamente com o modelo atualmente implementado, utilizando métricas adequadas à funcionalidade a avaliar. Os modelos de reescrita de consultas são ajustados e avaliados utilizando uma vasta gama de dados públicos que representam consultas com diferentes propriedades (linguagem, comprimento, formatação, estilos e tons) para suportar a maior variedade de cenários de pesquisa. Os nossos dados de treino e testes são retirados de:
Fontes dos documentos:
- Referências académicas e industriais
- Dados do cliente (apenas testes, realizados com permissão do cliente)
Fontes de consultas:
- Conjuntos de consultas de benchmark
- Conjuntos de consultas fornecidos pelo cliente (apenas testes, realizados com permissão do cliente)
- Conjuntos sintéticos de consultas
- Conjuntos de consultas gerados por humanos
Fontes de rótulos para pontuação de pares de consultas e documentos:
- Rótulos de referência académicos e industriais
- Etiquetas de cliente (apenas testes, realizadas com permissão do cliente)
- Etiquetas de dados sintéticos
- Rótulos com pontuação humana
Avaliar e integrar a reescrita de consultas para o seu uso
Como a reescrita de consultas foi treinada em conteúdo público, as consultas sintéticas variam consoante as consultas que lhe são emitidas. Por isso, é importante usar o seu próprio julgamento e pesquisa ao utilizar este conteúdo para tomar decisões.
Limitações técnicas, fatores operacionais e alcances
Embora a habilidade GenAI Prompt ofereça capacidades poderosas, é essencial reconhecer certas limitações:
- A competência baseia-se em filtros de conteúdo configurados pelo cliente dentro do Foundry. O Pesquisa de IA do Azure não oferece mecanismos adicionais de segurança de conteúdo para esta competência.
- A qualidade do conteúdo gerado por IA depende da eficácia dos prompts e do modelo de linguagem subjacente. São necessários testes rigorosos para garantir que o resultado cumpre os padrões desejados.
- O processamento de grandes volumes de dados com prompts complexos pode exigir recursos computacionais significativos e pode causar latência. Planeie e aloque recursos de forma inteligente não só para manter o desempenho e a relação custo-benefício, mas também para evitar possíveis atrasos no processamento dos dados.
Desempenho do sistema
Boas práticas para melhorar o desempenho do sistema
Para otimizar o desempenho da competência GenAI Prompt:
- Utilize a ferramenta debug sessions da Pesquisa de IA do Azure para testar prompts em documentos de exemplo, garantindo que o conteúdo gerado por IA está alinhado com as expectativas antes da implementação completa.
- Crie prompts claros e detalhados para guiar eficazmente o modelo de linguagem, reduzindo a probabilidade de resultados irrelevantes ou imprecisos.
- Monitorizar o desempenho do sistema e escalar recursos conforme necessário para lidar com as exigências computacionais do processamento de IA.
- Incentive a supervisão humana dos resultados antes da publicação ou disseminação. Com a IA generativa, existe potencial para gerar conteúdos que possam ser ofensivos ou irrelevantes para a tarefa em questão.
Avaliação da competência do GenAI Prompt
Avaliar e integrar a capacidade do GenAI Prompt para o seu uso
Para maximizar os benefícios da competência GenAI Prompt no seu contexto específico, considere os seguintes passos:
- Determine os objetivos específicos de enriquecimento, como gerar resumos concisos, extrair entidades-chave ou criar metadados descritivos, para alinhar a aplicação da competência com as necessidades do seu negócio.
- Comece com um subconjunto dos seus dados para avaliar o desempenho da competência e fazer os ajustes necessários. Esta abordagem permite experimentação controlada e refinamento antes da implementação em larga escala.
- Estabelecer mecanismos para monitorizar a qualidade e o impacto do conteúdo gerado por IA. Solicite feedback dos utilizadores finais para identificar áreas a melhorar e garantir que os dados enriquecidos cumprem as expectativas dos utilizadores.
Limitações técnicas, fatores operacionais e alcances
Podem existir casos em que as subconsultas geradas pelo LLM são irrelevantes, excessivamente restritivas ou aumentam os custos de tokens. A recuperação agentica suporta todas as linguagens tratadas pela família GPT-4o, mas a qualidade do plano de consulta gerado ainda depende da clareza da entrada do utilizador. Como a recuperação agentical depende do ranker semântico para cada subconsulta, deve ter o ranker semântico ativado no índice. O "Semantic ranker" é uma funcionalidade premium baseada em tokens; embora as tarifas de classificação sejam dispensadas durante a fase inicial da pré-visualização pública, elas serão aplicadas mais tarde e devem ser consideradas no custo total de posse.
Antes de mover a recuperação agêntica para um ambiente de produção, realize testes adicionais para confirmar que as subconsultas e passagens retornadas são adequadas ao caso de uso pretendido, que a latência e o custo cumprem os seus objetivos de nível de serviço e que os dados de fundamentação não expõem conteúdos sensíveis ou não conformes.
Desempenho do sistema
Como em qualquer sistema de modelos linguísticos em grande escala, diferentes utilizadores podem chegar a diferentes julgamentos sobre a utilidade ou relevância das passagens devolvidas, pelo que o desempenho deve ser definido de forma flexível. Para a recuperação agencial, consideramos um bom desempenho quando a aplicação de ponta a ponta entrega o conteúdo que os seus utilizadores esperam — sem latência, custo ou resultados nocivos inaceitáveis.
A eficácia da recolha agente depende de muitos fatores do mundo real:
- Prompt / duração do histórico de chat
- Número de subconsultas geradas por LLM
- Tamanho e esquema do índice (palavra-chave, vetor, híbrido)
- Escolha do modelo de planeamento (GPT-4o vs. GPT-4o-mini)
- Configuração da pesquisa semântica e limiares de pontuação
Boas práticas para melhorar o desempenho do sistema
- Resume ou reduza os turnos de chat mais antigos para manter o uso de tokens baixo.
- Ajuste o limiar do classificador para que apenas passagens altamente relevantes sejam retornadas
- Use filtros sempre que possível
Avaliação da recuperação agentica
A recuperação agêntica tem sido avaliada através de testes internos, incluindo julgamento automatizado e humano sobre múltiplos conjuntos de dados. Os testes incluíram a avaliação da relevância dos resultados da recuperação agêntica em comparação com aqueles dos resultados apenas com classificação semântica.
Métodos de avaliação
Cada configuração candidata de recuperação agêntica, definida pelo seu prompt do planejador, variante do modelo, contagem de subconsultas e limiares de classificação, é avaliada diretamente em comparação com a linha de base de produção. Aplicamos um conjunto de métricas de relevância, segurança, latência e custo escolhidas especificamente para cenários de recuperação multi-consulta. Para garantir fiabilidade em casos de uso reais, a afinação e o teste são realizados numa ampla mistura de conjuntos de dados públicos e aprovados pelo cliente, que variam em linguagem, comprimento da consulta, formatação, estilo e tom conversacional. O material de teste é obtido de:
Fontes dos documentos:
- Referências académicas e industriais
- Dados do cliente (apenas testes, realizados com permissão do cliente)
- Fontes de consultas:
- Conjuntos de consultas de benchmark
- Conjuntos de consultas fornecidos pelo cliente (apenas testes, realizados com permissão do cliente)
- Conjuntos sintéticos de consultas
- Conjuntos de consultas gerados por humanos
Fontes de rótulos para pontuação de pares de consultas e documentos:
- Rótulos de referência académicos e industriais
- Etiquetas de cliente (apenas testes, realizadas com permissão do cliente)
- Etiquetas de dados sintéticos
- Rótulos com pontuação humana
Avaliar e integrar a recuperação agential para o seu uso
Como o planeador de recuperação agente é treinado em grande parte com dados públicos, a qualidade e relevância das subconsultas geradas variarão consoante o seu domínio e as instruções específicas do utilizador. Para maximizar os benefícios da recuperação agential no seu contexto específico, considere os seguintes passos:
- Valide o resultado antes de o utilizar para tomar decisões críticas para o negócio: Inspecione manualmente uma amostra de subconsultas geradas e documentos devolvidos para confirmar que estão alinhados com a terminologia, precisão e requisitos de conformidade do domínio.
- Forneça informação específica do domínio ao planeador. Forneça mapas de sinónimos e um histórico completo de conversas para que o LLM possa parafrasear e decompor consultas numa linguagem que corresponda ao seu conteúdo, melhorando a recordação e a precisão.
- Implemente lógica de recurso ou de salvaguarda: Se o planeador gerar subconsultas de baixa confiança ou fora do âmbito, encaminhe o pedido para uma pesquisa por palavra-chave ou vetorial mais simples, ou mostre uma sugestão de esclarecimento ao utilizador, evitando que respostas pouco fiáveis se propaguem nos processos subsequentes.
Saiba mais sobre IA responsável
- Princípios de IA da Microsoft
- Recursos de IA responsável da Microsoft
- Microsoft Azure Cursos de aprendizagem sobre IA responsável
Saiba mais sobre o Pesquisa de IA do Azure
Comentários
Esta página foi útil?
No
Precisa de ajuda com este tópico?
Quer tentar utilizar o perguntar e Aprender para obter esclarecimentos ou orientações ao longo deste tópico?
Recursos adicionais
-
Last updated on
2026-04-30