Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Traduções não em inglês são fornecidas apenas para conveniência. Consulte a EN-US versão deste documento para obter a versão definitiva.
O que é uma Nota de Transparência?
Um sistema de IA inclui não apenas a tecnologia, mas também as pessoas que a usarão, as pessoas que serão afetadas por ela e o ambiente no qual ela é implantada. A criação de um sistema adequado para sua finalidade pretendida requer uma compreensão de como a tecnologia funciona, quais são suas funcionalidades e limitações e como obter o melhor desempenho. as Notas de Transparência da Microsoft destinam-se a ajudá-lo a entender como nossa tecnologia de IA funciona, as escolhas que os proprietários do sistema podem fazer que influenciam o desempenho e o comportamento do sistema e a importância de pensar em todo o sistema, incluindo a tecnologia, as pessoas e o meio ambiente. Você pode usar Notas de Transparência ao desenvolver ou implantar seu próprio sistema ou compartilhá-las com as pessoas que usarão ou serão afetadas pelo seu sistema.
as Notas de Transparência da Microsoft fazem parte de um esforço mais amplo em Microsoft para colocar nossos Princípios de IA em prática. Para saber mais, consulte os princípios de IA Microsoft.
As noções básicas de Pesquisa de IA do Azure
Introdução
Pesquisa de IA do Azure oferece aos desenvolvedores ferramentas, APIs e SDKs para criar uma experiência de pesquisa avançada sobre conteúdo privado, heterogêneo em aplicativos web, móveis e empresariais. A pesquisa é fundamental para qualquer aplicativo que apresenta dados aos usuários. Cenários comuns incluem pesquisa de catálogos ou documentos, repositórios de varejo online ou exploração de dados sobre conteúdo proprietário.
Os dados pesquisáveis podem estar na forma de texto ou vetores e ingeridos as-is de uma fonte de dados ou enriquecidos usando IA para melhorar a experiência de pesquisa geral. Os desenvolvedores podem converter dados int em representações numéricas (chamados de vetores), optando por chamar modelos de machine learning externos (conhecidos como modelos de inserção). Opcionalmente, os indexadores podem incluir conjuntos de habilidades que dão suporte a um conjunto avançado de enriquecimento de dados por meio de vários recursos Azure Language in Foundry Tools, como Reconhecimento de Entidades Nomeadas (NER) e detecção de informações pessoalmente identificáveis (PII), e funcionalidades do Azure Vision in Foundry Tools, incluindo reconhecimento óptico de caracteres (OCR) e análise de imagens.
Consulte as guias a seguir para obter mais informações sobre como Pesquisa de IA do Azure melhora a experiência de pesquisa usando ferramentas de pesquisa ou outros sistemas de IA para entender melhor a intenção, a semântica e a estrutura implícita do conteúdo de um cliente.
- Enriquecimento de IA
- Pesquisa de vetor
- Classificador semântico
- Reescrita de consulta
- Habilidade de Prompt do GenAI
- Recuperação por meio de agentes
O enriquecimento de IA é a aplicação de modelos de aprendizado de máquina das Foundry Tools sobre conteúdo que não é facilmente pesquisável em sua forma bruta. Por meio de enriquecimento, análise e inferência são usados para criar conteúdo pesquisável e estrutura em que nenhum existia anteriormente.
O enriquecimento de IA é uma extensão opcional do pipeline do indexador da Pesquisa de IA do Azure que se conecta ao Foundry Tools na mesma região do serviço de pesquisa do cliente. Um pipeline de enriquecimento tem os mesmos componentes principais de um indexador típico (indexador, fonte de dados, índice), além de um conjunto de habilidades que especifica as etapas de enriquecimento atômico. Um conjunto de habilidades pode ser montado usando habilidades integradas com base nas APIs de Ferramentas do Foundry, como Visão e Linguagem, ou habilidades personalizadas que executam código externo fornecido por você.
A pesquisa de vetor é um método de recuperação de informações em que documentos e consultas são representados em um índice como vetores em vez de texto sem formatação. Na pesquisa de vetor, os modelos de machine learning, hospedados externamente de Pesquisa de IA do Azure , geram as representações de vetor de entradas de origem, que podem ser conteúdo de texto, imagens, áudio ou vídeo. Essa representação matemática e normalizada de conteúdo, chamada de inserções de vetor, fornece uma base comum para cenários de pesquisa.
Quando tudo é um vetor, uma consulta pode encontrar uma correspondência no espaço de vetor, mesmo que o conteúdo original associado esteja em um tipo de mídia diferente, como imagens versus texto ou idioma do que a consulta. O mecanismo de pesquisa verifica o índice em busca de conteúdo de vetor mais semelhante, ou seja, o mais próximo, do vetor na consulta. A correspondência em uma representação de vetor matemático em vez de palavras-chave torna muito mais provável encontrar correspondências que compartilham significado semântico, mas são textualmente distintas, como "carro" e "automático", por exemplo. Isso fornece uma introdução mais detalhada às inserções de vetor e como o algoritmo de similaridade funciona.
Termos-chave
| Termo | Definição |
|---|---|
| Inserções de vetor | Uma maneira altamente otimizada de representar dados que refletem o significado e a compreensão extraídos por um modelo de machine learning de imagens, áudio, vídeo ou texto. O conteúdo é convertido em inserções de vetor tanto na indexação quanto no tempo de consulta. A pesquisa de vetor equivale a inserir as inserções fornecidas em uma consulta e procurar as inserções mais semelhantes no índice. Os resultados normalmente são classificados pelo grau de similaridade. |
| Espaço de incorporação | Todos os vetores no corpus de um único campo ocupam o mesmo espaço de inserção em que itens semelhantes estão localizados próximos uns dos outros e itens diferentes estão mais distantes. A maior dimensionalidade do espaço de inserção pode incluir mais informações em um único vetor e melhorar consideravelmente a experiência de pesquisa, mas a um custo significativo do tamanho do armazenamento do índice e maior latência de consulta. |
O classificador semântico usa o contexto ou o significado semântico de uma consulta para calcular uma nova pontuação de relevância que promove resultados semanticamente mais próximos da intenção da consulta original à parte superior. O conjunto de resultados inicial pode vir de uma pesquisa de palavra-chave com classificação BM25 , pesquisa de vetor ou uma pesquisa híbrida que inclui ambos. Também cria e retorna "legendas" extraindo o conteúdo literal encontrado no resultado e "destaca" para chamar a atenção para o conteúdo importante dentro do resultado. Ele também poderá retornar uma "resposta" se a consulta tiver as características de uma pergunta ("qual é o ponto de congelamento da água") e o resultado contiver texto com as características de uma resposta ("a água congela a 0°C ou 32°F").
Termos-chave
| Termo | Definição |
|---|---|
| Classificador semântico | Usa o contexto e o significado semântico de uma consulta para melhorar a relevância da pesquisa usando o reconhecimento vocal para classificar novamente os resultados da pesquisa. |
| Legendas semânticas e realces | Extrai sentenças e frases de um documento que melhor resumem o conteúdo, com realces sobre as principais passagens, facilitando a leitura. Legendas que resumem um resultado são úteis quando campos de conteúdo individuais são muito densos para a página de resultados. O texto realçado eleva os termos e frases mais relevantes para que os usuários possam determinar rapidamente por que uma correspondência foi considerada relevante. |
| Respostas semânticas | Fornece uma subestrutura opcional e adicional retornada de uma consulta semântica. Ele fornece uma resposta direta para uma consulta que se parece com uma pergunta. Requer que um documento tenha texto com as características de uma resposta. |
A reescrita de consulta cria consultas sintéticas, que são consultas que são criadas artificialmente ou geradas a partir da entrada real do cliente para melhorar o recall (a fração de documentos relevantes recuperados do número total de documentos disponíveis) da classificação BM25, pesquisa de vetor ou uma pesquisa híbrida. A consulta original é combinada com as consultas sintéticas para maximizar o recall do mecanismo de pesquisa.
A habilidade do Prompt do GenAI faz parte do catálogo de habilidades da Pesquisa de IA do Azure , permitindo que os clientes aprimorem seus índices de pesquisa com conteúdo gerado por IA com base em seus dados. Usando os próprios dados e preferências da organização do cliente, essa habilidade ajuda a produzir resumos, respostas ou insights personalizados que se alinham às suas necessidades específicas.
Isso significa que quando o usuário final pesquisa o conteúdo dos clientes por meio da Pesquisa de IA, o conteúdo gerado por IA pode fornecer resultados mais informativos e com reconhecimento de contexto, tornando mais fácil para os usuários encontrarem as informações que estão procurando.
Termos-chave
| Termo | Definição |
|---|---|
| Habilidades | Uma habilidade da Pesquisa de IA do Azure é um componente de processamento modular dentro do pipeline de enriquecimento da Pesquisa de IA do Azure. Essas habilidades aplicam transformações orientadas por IA a conteúdo bruto, como texto, imagens ou documentos, durante a indexação, permitindo a extração de informações estruturadas e pesquisáveis de dados não estruturados. |
| Prompt | O texto que você envia para o serviço na chamada à API. Em seguida, esse texto é inserido no modelo. Por exemplo, pode-se inserir o seguinte prompt: Converta as perguntas em um comando: P: Pergunte a Constance se precisamos de um pouco de pão A: send-msg find constance Precisamos de pão? P: Envie uma mensagem para Greg para descobrir se as coisas estão prontas para quarta-feira. A: Send-msg find greg tudo pronto para quarta-feira? |
| Pesquisar índices | Em Pesquisa de IA do Azure , um índice é a estrutura de dados que contém o conteúdo pesquisável, define como ele é armazenado e controla como o serviço o interpretará ao executar uma consulta. |
A recuperação baseada em agentes é uma arquitetura de processamento de consultas paralela que utiliza um modelo de linguagem de grande porte (LLM) de conversação como um "planejador de consultas". O LLM transforma o histórico de conversas de um usuário em uma ou várias subconsultas focadas, conforme necessário. Essas subconsultas são executadas simultaneamente no índice Pesquisa de IA do Azure e o serviço mescla os principais resultados, retornando:
- Uma única cadeia de caracteres de conteúdo que contém as passagens mais relevantes (dados de fundamentação).
- Uma matriz de referências (opcional) que expõe os documentos de origem completos ou partes.
- Uma matriz de atividades que lista todas as operações, a contagem de tokens e a latência, para auxiliar no controle de custos e na depuração.
Termos-chave
| Termo | Definição |
|---|---|
| Recuperação com agentes | Isso se refere a um agente de IA que planeja e executa uma sequência de etapas para recuperar informações de fontes base. Isso envolve atividades como consultar e refinar pesquisas para obter as informações mais relevantes para a consulta. |
| Aterramento de dados | Conjunto de documentos/informações retornados pela Recuperação Agentic. Serve como base factual que um LLM externo pode citar ou transformar em uma resposta em linguagem natural, garantindo rastreabilidade e reduzindo o risco de alucinações. |
| Planejador de consultas | Divide o histórico de conversas em subconsultas para encontrar os dados de aterramento mais relevantes para a consulta de pesquisa subjacente. |
| Subconsulta | Uma única consulta gerada por uma LLM. As subconsultas são baseadas em perguntas do usuário, histórico de chat e parâmetros na solicitação. As subconsultas direcionam seus documentos indexados (texto sem formatação e vetores) em Pesquisa de IA do Azure . |
Capacidades
- Enriquecimento de IA
- Pesquisa de vetor
- Classificador semântico
- Reescrita de consulta
- Habilidade de Prompt do GenAI
- Recuperação por meio de agentes
Comportamento do sistema
Várias habilidades embutidas para enriquecimento de IA no Pesquisa de IA do Azure aproveitam as Foundry Tools. Consulte as Notas de Transparência para cada habilidade interna vinculada abaixo para obter considerações ao optar por usar uma habilidade:
- Habilidade de extração de frase-chave: Idioma – Extração de Frase-Chave
- Habilidade de Detecção de Idioma: Idioma — Detecção de Idioma
- Habilidade de Vinculação de Entidade: Idioma – Vinculação de Entidade
- Habilidade de Reconhecimento de Entidade: Idioma - Reconhecimento de Entidades Nomeadas (NER)
- Habilidade de Detecção de PII: Linguagem – Detecção de PII
- Habilidade de Sentimento: Linguagem – Análise de Sentimento
- Habilidade de Análise de Imagem: Visão – Análise de Imagem
- Habilidade do OCR: Visão – OCR
- Habilidade de Layout de Documento: Inteligência de Documento
Consulte a documentação de cada habilidade para saber mais sobre seus respectivos recursos, limitações, desempenho, avaliações e métodos para integração e uso responsável. Observe que o uso dessas técnicas em combinação pode levar a efeitos cumulativos (por exemplo, erros introduzidos ao usar OCR continuarão a ocorrer ao utilizar a extração de frases-chave).
Casos de uso
Exemplos de casos de uso
Como Pesquisa de IA do Azure é uma solução de pesquisa de texto completo, a finalidade do enriquecimento de IA é melhorar o utilitário de pesquisa de conteúdo não estruturado. Aqui estão alguns exemplos de cenários de enriquecimento de conteúdo compatíveis com as habilidades internas:
- A tradução e a detecção de idioma habilitam a pesquisa multilíngue.
- O reconhecimento de entidade extrai pessoas , locais e outras entidades de grandes partes do texto.
- A extração de frase-chave identifica e gera termos importantes.
- O OCR reconhece texto impresso e manuscrito em arquivos binários.
- A análise de imagem descreve o conteúdo da imagem e gera as descrições como campos de texto pesquisáveis.
- Vetorização integrada é um recurso de visualização que chama o modelo de inserções Azure OpenAI para vetorizar dados e armazenar inserções em Pesquisa de IA do Azure para pesquisa de similaridade.
Comportamento do sistema
Na pesquisa de vetor, o mecanismo de pesquisa procura vetores dentro do espaço de inserção no índice para localizar aqueles próximos ao vetor de consulta. Essa técnica é chamada de pesquisa de vizinho mais próxima. Isso também ajuda a quantificar o grau de similaridade ou distância entre os itens. Um alto grau de semelhança de vetor indica que os dados originais também eram semelhantes. Os dois algoritmos de pesquisa de vetor compatíveis com Pesquisa de IA do Azure têm abordagens diferentes para esse problema, trocando características diferentes, como latência, taxa de transferência, recall e memória.
Localizar o conjunto verdadeiro de vizinhos "k" mais próximos requer a comparação completa do vetor de entrada com todos os vetores no conjunto de dados. Embora cada cálculo de similaridade de vetor seja relativamente rápido, executar essas comparações exaustivas em grandes conjuntos de dados é computacionalmente caro e lento devido ao grande número de comparações necessárias. Além disso, quanto maior a dimensionalidade de cada vetor, mais complexo e mais lento serão os cálculos em cada vetor.
Para lidar com esse desafio, métodos de busca por vizinho mais próximo aproximado (ANN) são usados para equilibrar a recuperação com a velocidade. Esses métodos podem encontrar com eficiência um pequeno conjunto de vetores candidatos que provavelmente serão semelhantes ao vetor de consulta, reduzindo o número total de comparações de vetores. Pesquisa de IA do Azure usa o algoritmo Hierárquico Navigable Small World (HNSW) para organizar pontos de dados de alta dimensão em uma estrutura de grafo hierárquico probabilística que permite uma pesquisa de similaridade rápida, permitindo uma compensação ajustável entre a precisão da pesquisa e o custo computacional.
A Pesquisa de IA do Azure também dá suporte a várias métricas de similaridade para determinar o vizinho mais próximo e a pontuação de cada resultado vetorial. Essas métricas incluem cosseno, "Euclidiana" (também conhecida como "norma l2") e "produto escalar". O cosseno calcula o ângulo entre dois vetores. Euclidiano calcula a distância euclidiana entre dois vetores, que é a norma l2 da diferença dos dois vetores. O produto escalar é afetado pelas magnitudes dos vetores e pelo ângulo entre eles. Para espaços de incorporação normalizados, o produto escalar é equivalente à similaridade de cosseno, mas é mais eficiente.
Casos de uso
Exemplos de casos de uso
Há muitos cenários em que a pesquisa de vetor é útil e eles são limitados apenas pelos recursos do modelo usado para gerar inserções de vetor. Aqui estão alguns casos gerais de uso em que a pesquisa de vetor pode ser usada:
- Semantic search: extrair a compreensão semântica do texto usando um modelo, como os modelos de inserção do Serviço OpenAI do Azure.
- Pesquisar em diferentes tipos de dados (multimodal): codificar conteúdo proveniente de imagens, texto, áudio e vídeo ou uma combinação e fazer uma única pesquisa em todos eles.
- Pesquisa multilíngue: use um modelo de inserções multilíngues para representar seu documento em vários idiomas para encontrar resultados em idiomas com suporte.
- Pesquisa híbrida: a pesquisa de vetor é implementada no nível do campo, o que significa que você pode criar consultas que incluem campos de vetor e campos de texto pesquisáveis. As consultas são executadas em paralelo e os resultados são mesclados em uma única resposta. Os resultados da pesquisa híbrida com classificação semântica foram mostrados para fornecer os melhores resultados qualitativos.
- Pesquisa de vetor filtrada: uma consulta pode incluir uma consulta vetor e uma expressão de filtro. Os filtros aplicados a outros tipos de dados são úteis para incluir ou excluir documentos com base em outros critérios.
- Banco de dados vetor: esse repositório de vetores puro é para memória de longo prazo ou uma base de dados de conhecimento externo para LLMs (Modelos de Linguagem Grande). Por exemplo, use a Pesquisa de IA do Azure como um índice de vetor no fluxo prompt flow do Azure Machine Learning para aplicativos de Geração Aumentada de Recuperação (RAG).
Considerações ao escolher um caso de uso
Pode haver considerações e preocupações associadas ao modelo específico que você escolhe para gerar inserções de vetor. Cada modelo pode ter seus próprios problemas com preconceito e imparcialidade e deve ser avaliado antes de ser usado em seu aplicativo. Pesquisa de IA do Azure não fornece modelos para vetorizar o conteúdo como parte do serviço. Consulte a Serviço OpenAI do Azure Nota de Transparência para obter exemplos dessas considerações. Outros modelos de terceiros ou OSS têm considerações próprias para revisão.
Comportamento do sistema
Classificar os resultados da primeira etapa de recuperação de camada é um processo altamente intensivo de recursos. Para concluir o processamento do classificador dentro da latência esperada de uma operação de consulta, somente os 50 principais resultados do mecanismo de recuperação são enviados para o classificador semântico como entradas. Se for muito longo, os 50 resultados serão enviados primeiro para uma etapa de resumo que extrai o conteúdo mais relevante de cada resultado antes de executar o classificador semântico.
Na etapa de resumo, o documento recuperado é colocado primeiro em um processo de preparação que concatena as diferentes entradas de documento em uma única cadeia de caracteres longa. Se a cadeia de caracteres for muito longa, ocorrerá um exercício de corte, com ênfase específica sobre a retenção de conteúdo contido nos campos adicionados à configuração semântica. Depois que as cadeias de caracteres são preparadas, elas são passadas por meio de modelos de compreensão de leitura de máquina e representação de linguagem para determinar quais sentenças e frases fornecem o melhor resumo em relação à consulta. Essa fase extrai o conteúdo da cadeia de caracteres que será passado para o estágio de classificação semântica e, opcionalmente, gera uma legenda semântica ou uma resposta semântica.
A etapa final, classificação semântica, determina a relevância do conteúdo extraído na etapa anterior para a consulta do usuário e gera uma pontuação de classificação semântica variando de 4 (altamente relevante) a 0 (irrelevante). Essa etapa é baseada no texto da consulta e no texto resumido e envolve cálculos mais complexos do que os da camada de recuperação.
Casos de uso
Exemplos de casos de uso
O classificador semântico pode ser usado em vários cenários. Os casos de uso pretendidos pelo sistema incluem:
- RAG (Geração Aumentada por Recuperação): O classificador semântico permite que você baseie respostas de seus aplicativos de IA generativos em resultados de pesquisa relevantes que superem o limite de pontuação de relevância que você define. Por exemplo, o Serviço OpenAI do Azure em seus dados utiliza a Pesquisa de IA do Azure para complementar os modelos OpenAI do Azure com seus dados. Você pode usar o classificador semântico dentro desse serviço para melhorar a relevância das informações fornecidas para o modelo Azure OpenAI.
- Pesquisa de conteúdo: o classificador semântico permite que você pesquise conteúdo relevante em seus dados analisando texto e metadados. A pesquisa no site learn.microsoft.com utiliza um classificador semântico para melhorar a relevância das buscas para desenvolvedores de software que procuram documentação técnica da Microsoft.
- Pesquisa de eCommerce: o classificador semântico permite que as empresas de comércio eletrônico aprimorem sua experiência de pesquisa fornecendo resultados relevantes do produto com base na relevância semântica. Por exemplo, os varejistas online usam o classificador semântico para otimizar sua experiência de eCommerce fornecendo resultados de pesquisa relevantes para seus compradores online.
- QnA: Pesquisa de IA do Azure permite que as organizações forneçam uma experiência de conversa para seus usuários respondendo perguntas com base nas informações disponíveis em seus bancos de dados. Por exemplo, um fabricante pode usar o ranker semântico para aumentar as informações disponíveis para um chatbot. Os engenheiros podem usar esse chatbot para fazer perguntas e recuperar documentos internos altamente relevantes relacionados à consulta e às respostas instantâneas nos documentos recuperados.
Considerações ao escolher um caso de uso
Incentivamos os clientes a usar o ranker semântico em suas soluções ou aplicativos inovadores. No entanto, aqui estão algumas considerações ao escolher um caso de uso:
- Informações confidenciais : os modelos de machine learning que habilitam o ranker semântico processam os dados recuperados em uma consulta de pesquisa, incluindo informações confidenciais, como detalhes pessoais e informações financeiras. Considere quaisquer implicações de privacidade e segurança antes de implementar o classificador semântico para esses casos de uso.
- Preconceito e imparcialidade : o ranker semântico é alimentado por modelos de aprendizado profundo. Esses modelos de aprendizado profundo foram treinados usando conteúdo público. Os dados do cliente são pontuados pelos modelos de classificação semântica. Avalie a saída do classificador semântico ao selecionar casos de uso, especialmente para casos de uso que têm implicações para imparcialidade e equidade, como contratação e recrutamento.
- Conformidade com a regulamentação: alguns setores, como saúde e finanças, são altamente regulamentados e podem ter restrições sobre o uso de IA e machine learning. Antes de usar o classificador semântico nesses setores, verifique se a solução está em conformidade com as normas e diretrizes relevantes.
Comportamento do sistema
A consulta original é enviada para um fine-tuned Small Language Model (SLM) hospedado pelo Pesquisa de IA do Azure . Esse modelo foi treinado usando conteúdo público. O SLM transforma a consulta original em um conjunto de consultas sintéticas. Essas consultas sintéticas são semanticamente próximas à intenção da consulta original, mas incluem um conjunto diferente de termos para melhorar o recall do mecanismo de pesquisa.
As consultas sintéticas são então combinadas com a consulta original e enviadas para o mecanismo de pesquisa. Quando ele executa a classificação BM25, os termos-chave das consultas sintéticas são combinados com a consulta original. Quando ele executa a pesquisa de vetor, a consulta original é concatenada com as consultas sintéticas antes da etapa de inserção de vetor .
Casos de uso
Exemplos de casos de uso
A reescrita de consulta pode ser usada em vários cenários. A reescrita de consulta requer o uso do classificador semântico.
- Interação de chat com seus dados: a reescrita de consulta permite que você ancore respostas de seus aplicativos de IA generativos em resultados de pesquisa relevantes que atendem ao limiar de relevância que você define. Por exemplo, o Serviço OpenAI do Azure em Seus Dados utiliza a Pesquisa de IA do Azure para complementar os modelos OpenAI do Azure com seus dados. Você pode usar a reescrita de consulta nesse serviço para melhorar a relevância dos resultados das informações fornecidas para o modelo Azure OpenAI.
- Conversational Questions and Answers (QnA): Pesquisa de IA do Azure permite que as organizações forneçam uma experiência de conversa para seus usuários respondendo perguntas com base nas informações disponíveis em seus bancos de dados. Por exemplo, um fabricante pode usar o ranker semântico para aumentar as informações disponíveis para um chatbot. Os engenheiros podem usar esse chatbot para fazer perguntas e recuperar documentos internos altamente relevantes relacionados à consulta e às respostas instantâneas nos documentos recuperados.
Considerações ao escolher um caso de uso
Incentivamos os clientes a usar a reescrita de consulta em suas soluções ou aplicativos inovadores. No entanto, aqui estão algumas considerações ao escolher um caso de uso:
- Informações confidenciais e PII: o SLM ajustado , que permite a reescrita de consulta, processa a consulta de pesquisa, que pode conter informações confidenciais. Considere quaisquer implicações de privacidade e segurança antes de implementar a reescrita de consulta para esses casos de uso.
- Redigir informações pessoais para reduzir o viés inconsciente. Por exemplo, durante o processo de revisão de currículos de uma empresa, eles podem querer bloquear o nome, o endereço ou o número de telefone de um candidato para ajudar a reduzir o gênero inconsciente ou outros preconceitos durante a pesquisa.
- Considerações legais e regulatórias. As organizações precisam avaliar possíveis obrigações legais e regulatórias específicas ao usar qualquer Pesquisa de IA, o que pode não ser apropriado para uso em todos os setores ou cenários. As restrições podem variar de acordo com os requisitos regulatórios regionais ou locais. Além disso, a Pesquisa de IA não foi projetada para e não pode ser usada de maneiras proibidas nos termos de serviço aplicáveis e nos códigos de conduta relevantes.
A funcionalidade Prompt do GenAI permite que os clientes passem o conteúdo do documento, existente em suas fontes de dados, e prompts personalizados para um modelo de linguagem próprio, hospedado no Microsoft Foundry. O modelo de linguagem processa a entrada e retorna conteúdo enriquecido, que é ingerido no índice de pesquisa junto com o conteúdo original do documento. Esse processo permite o aumento de índices de pesquisa com resumos gerados por IA, legendas de imagem e extração de entidade, entre outros, com base em critérios definidos pelo cliente.
Os exemplos a seguir mostram como funciona a habilidade do Prompt do GenAI.
Sumarização de tickets sem exemplos
Objetivo: permitir que os agentes de suporte percorram threads de e-mail com várias páginas em poucos segundos.
Como funciona:
- Durante a indexação, cada longa conversa de ticket é dividida em segmentos lógicos (solicitação inicial, perguntas adicionais, logs de diagnóstico etc.).
- Para cada segmento, o modelo de linguagem é instruído a "resumir esta seção em três frases nítidas".
- Os resumos resultantes substituem o texto bruto durante a recuperação, de modo que os agentes, e os pipelines downstream do RAG, possam ver apenas a essência destilada.
Por que isso ajuda: resumos concisos, no nível do segmento, reduzem o tamanho do prompt, aceleram a geração de resposta e ajudam os agentes a se concentrarem no problema principal do cliente.
Extração de entidades com poucos exemplos
Objetivo: Suportar consultas como "Mostre-me todos os tickets em que o Produto X apresentou falha com erro 500."
Como funciona
- O texto completo do ticket é enviado para a skill juntamente com um exemplo prático que demonstra o formato de saída desejado (uma lista de entidades-chave, como nome do produto, código de erro, sistema operacional e gravidade).
- O modelo extrai todas as ocorrências de 〈produto, error_code, plataforma, gravidade.
- Essa lista estruturada é armazenada com o documento, permitindo aplicar filtros instantâneos que destacam, por exemplo, todos os erros graves no iOS.
Por que isso ajuda: entidades pré-computadas transformam mensagens de clientes de forma livre em dados filtráveis, permitindo que as lideranças de suporte identifiquem padrões e priorizem correções sem análise manual.
Classificação de roteamento de tickets com um único exemplo
Meta: rotear automaticamente cada tíquete para a fila correta.
Como funciona:
- Cada tíquete é analisado com um prompt que lista cinco categorias de suporte: Cobrança, Problema Técnico, Acesso à Conta, Solicitação de Recurso e Comentários Gerais, além de um exemplo de referência ("Exemplo de tíquete → Cobrança").
- O modelo atribui exatamente um rótulo, com base nas cinco categorias de suporte acima, a cada ticket que entra no sistema de Pesquisa de IA como entrada.
- O sistema de suporte técnico usa o rótulo para enviar consultas de cobrança para especialistas em finanças, falhas técnicas para engenheiros e assim por diante.
Por que isso ajuda: a etiquetagem rápida e consistente reduz os tíquetes mal roteados, diminui o tempo de resolução e melhora a satisfação do cliente.
Sugestão de resolução por cadeia de raciocínio
Meta: forneça aos agentes de suporte a melhor próxima etapa para resolver o problema.
Como funciona
- O ticket inteiro — ou sua mensagem mais recente para o cliente — é passado para o modelo de linguagem.
- A mensagem do usuário instrui o modelo após o prompt do sistema: "Pense passo a passo internamente, mas produza apenas a próxima ação recomendada".
- A orientação retornada pode ser: "Peça ao cliente para limpar o cache e reinstalar a versão 3.2.1".
- Os agentes podem copiar a sugestão diretamente ou refiná-la antes de responder.
Por que isso ajuda: os agentes recebem uma recomendação acionável sem a cadeia de raciocínio privada do modelo, economizando tempo, mantendo as etapas de solução de problemas concisas e relevantes. Em certos casos, o agente de suporte não é inundado com informações desnecessárias.
Casos de uso
Exemplos de casos de uso
A ferramenta Prompt do GenAI aprimora o enriquecimento de dados no Pesquisa de IA do Azure , ajudando a garantir que a relevância da resposta esteja alinhada com a intenção e as expectativas do usuário. Ao integrar o conteúdo gerado por IA em índices de pesquisa, essa habilidade permite resultados de pesquisa mais precisos e contextualmente apropriados. Os principais aplicativos incluem:
- Gerando resumos concisos de documentos longos para facilitar a recuperação mais rápida de informações: um escritório de advocacia processa contratos extensivos e usa a habilidade do GenAI Prompt para criar breves resumos destacando cláusulas-chave, tornando mais fácil para os advogados revisar informações essenciais sem ler documentos inteiros.
- Criando descrições textuais para imagens para melhorar a pesquisa e a acessibilidade: uma empresa de mídia gerencia uma vasta biblioteca de imagens. Ao aplicar a habilidade do Prompt do GenAI, eles geram legendas descritivas para cada imagem, permitindo uma pesquisa e organização eficientes em seu sistema de gerenciamento de ativos digitais.
- Identificando e extraindo entidades ou fatos específicos de documentos com base em critérios personalizados: uma instituição de pesquisa analisa artigos científicos para extrair menções de compostos químicos e suas propriedades. A habilidade de Prompt do GenAI automatiza essa extração, populando um banco de dados estruturado para que os pesquisadores acessem dados relevantes rapidamente.
- Classificar documentos em categorias definidas para melhor organização e recuperação: uma seguradora recebe vários tipos de documentos diariamente. Usando a habilidade do Prompt do GenAI, eles classificam automaticamente esses documentos em categorias como Declarações, Atualizações de Política e Comentários do Cliente. Isso simplifica o processo de gerenciamento de documentos e facilita a localização de documentos específicos quando necessário.
Embora sejam aplicativos comuns, a habilidade é flexível, permitindo que os clientes definam prompts adaptados aos seus requisitos exclusivos.
Considerações ao escolher um caso de uso
É importante observar que as implantações de conteúdo, prompts e modelo de linguagem são recursos totalmente gerenciados pelo cliente. A Foundry dá suporte a filtros de segurança de conteúdo para implantações de modelo e os clientes são responsáveis por configurar esses filtros conforme necessário. Além das configurações disponíveis na Foundry, o Pesquisa de IA do Azure não aplica filtros adicionais de segurança de conteúdo na habilidade GenAI Prompt.
Ao implementar a habilidade de Prompt do GenAI, considere o seguinte:
- Implemente processos para revisão humana do conteúdo gerado por IA, especialmente ao aplicar transformações de prompt que possam afetar a confiabilidade das informações. Utilize a ferramenta debug sessions do Pesquisa de IA do Azure para testar prompts em documentos de exemplo antes da implantação em grande escala.
- Evite cenários em que o uso ou uso indevido do sistema possa resultar em danos físicos ou psicológicos significativos a um indivíduo. Por exemplo, cenários que diagnosticam pacientes ou prescrevem medicamentos têm o potencial de causar danos significativos. Incorporar uma revisão e supervisão humana significativas ao cenário pode ajudar a reduzir o risco de resultados nocivos.
- Considere cuidadosamente todos os casos de uso generativos. Cenários de geração de conteúdo podem ser mais propensos a produzir saídas não intencionais e esses cenários exigem considerações e mitigações cuidadosas.
- Considerações legais e regulatórias. As organizações precisam avaliar possíveis obrigações legais e regulatórias específicas ao usar qualquer Pesquisa de IA, o que pode não ser apropriado para uso em todos os setores ou cenários. As restrições podem variar de acordo com os requisitos regulatórios regionais ou locais. Além disso, a Pesquisa de IA não foi projetada para e não pode ser usada de maneiras proibidas nos termos de serviço aplicáveis e nos códigos de conduta relevantes.
Comportamento do sistema
A conversa original ou consulta de pesquisa é enviada para o modelo Azure OpenAI proprietário do cliente para executar as etapas de planejamento de consulta. O planejamento de consultas divide a conversa em uma série de subconsultas otimizadas que refletem a intenção subjacente do usuário com ortografia corrigida e sinônimos expandidos. Pesquisa de IA do Azure processa todas as subconsultas de uma só vez no sistema de recuperação de pesquisa completo. As subconsultas são processadas primeiro por uma combinação híbrida de pesquisa de palavra-chave e pesquisa de vetor. A pesquisa de palavra-chave localiza os documentos no índice de pesquisa com palavras-chave semelhantes às subconsultas. A pesquisa de vetor localiza documentos no índice de pesquisa que podem ter palavras-chave diferentes, mas significado subjacente semelhante às subconsultas. Os resultados dessa pesquisa híbrida são classificados novamente pelo classificador semântico para localizar os documentos com a melhor correspondência com a intenção da subconsulta. Em seguida, o serviço mescla e remove duplicatas dos resultados classificados, aplicando limites de resposta como o comprimento máximo de saída antes de enviar de volta a resposta final.
Casos de uso
Exemplos de casos de uso
- Fundamentação de dados para chatbots personalizados. Vincule o chatbot às políticas oficiais de RH da empresa e ao manual dos funcionários para que, quando alguém perguntar: "Quantos dias de férias eu recebo?" o chatbot puxa a resposta diretamente desses documentos em vez de adivinhar.
- Equipe os assistentes de conhecimento corporativos para respeitar o contexto, os filtros e o histórico de chat do usuário. Por exemplo, quando um funcionário pergunta sobre as metas para um período específico, o assistente usa sua função, os filtros atuais (por exemplo, região: EUA) e a conversa em andamento (por exemplo, o último tópico foi "pipeline Q2") para gerar uma resposta personalizada.
- Enfrente tarefas complexas de busca de informações em que uma única consulta de palavra-chave tenha baixo recall. Essas tarefas podem incluir guias de solução de problemas, pesquisa de literatura médica ou comparações de produtos. Por exemplo, se um técnico simplesmente pesquisa "erro de dispositivo" e recebe resultados genéricos, um recuperador agente pode levar em conta todo o histórico de conversa que pode incluir modelo de dispositivo, versão de software, histórico de manutenção e status de rede para exibir artigos precisos e relevantes.
- Certifique-se de total transparência sobre o que foi recuperado, por quê e a que custo. Por exemplo, ao resumir documentos regulatórios e resultados de auditoria anteriores, é essencial saber as fontes exatas (por exemplo, "arquivamento da SEC do 2º trimestre de 2023"), a lógica de seleção (por exemplo, "palavras-chave correspondentes: divulgação de risco, derivativos" e os custos associados (por exemplo, uso de token).
Considerações ao escolher um caso de uso
- Latência: adicionar uma segunda chamada LLM para planejamento de consulta inevitavelmente aumenta o tempo de ida e volta da solicitação. Mesmo com modelos rápidos, você deve comparar o atraso extra no tráfego de pico e verificar se a experiência geral permanece aceitável para seus usuários. Quando a latência for crítica, considere armazenar em cache consultas frequentes ou usar modelos de planejamento menores e mais rápidos.
- Custo: os encargos são acumulados em duas dimensões: tokens de modelo OpenAI e tokens de classificação de pesquisa. A chamada do planejador de consultas é cobrada pelo OpenAI do Azure tanto para tokens de entrada quanto de saída, enquanto cada subconsulta é cobrada pela Pesquisa de IA do Azure pelos tokens que deve classificar. Os tokens de classificação são gratuitos na fase inicial da visualização pública. Estime antecipadamente o número de tokens de modelo e de classificação para sua carga de trabalho.
- Entradas sensíveis: todo o histórico da conversa é encaminhado para o modelo de planejamento, o que significa que quaisquer dados de identificação pessoal ou confidenciais para os negócios saem do seu limite de confiança imediato. Remova, mascare ou oculte esses dados antes de invocar o LLM e documente essa mitigação em sua estratégia de proteção de dados.
- Limites de região e pré-visualização: a recuperação agêntica só está disponível em regiões em que o classificador semântico está disponível. Um agente individual pode apontar para apenas um índice de pesquisa. Confirme se a região que hospeda seus dados e modelo dá suporte à recuperação por agentes, e planeje agentes separados se você precisar abranger múltiplos índices ou geografias.
- Conformidade: confirme se o uso de um planejador de consultas orientado por LLM está em conformidade com requisitos regionais ou específicos do setor (por exemplo, residência de dados, privacidade ou regras de decisão automatizada em serviços de saúde ou finanças). Garanta a supervisão e o controle humanos adequados. Considere incluir controles para ajudar os desenvolvedores a verificar, revisar e/ou aprovar ações em tempo hábil, o que pode incluir a revisão de tarefas planejadas ou chamadas a fontes de dados externas.
- Considerações legais e regulatórias: os usuários precisam avaliar possíveis obrigações legais e regulatórias específicas ao usar as Ferramentas e soluções do Foundry, que podem não ser apropriadas para uso em todos os setores ou cenários. Além disso, as ferramentas ou soluções do Foundry não são projetadas e podem não ser usadas de maneiras proibidas em termos de serviço aplicáveis e códigos de conduta relevantes.
Limitações
- Enriquecimento de IA
- Pesquisa de vetor
- Classificador semântico
- Reescrita de consulta
- Habilidade de Prompt do GenAI
- Recuperação por meio de agentes
O enriquecimento de IA no Pesquisa de IA do Azure utiliza os recursos do indexador e da origem de dados do serviço para acionar as Foundry Tools e executar o enriquecimento de conteúdo. As limitações dos indexadores e das fontes de dados usadas nesse processo serão aplicadas. Examine a documentação do indexador e da fonte de dados para obter mais informações sobre essas limitações relacionadas. As limitações de cada Foundry Tool usada pelo pipeline de enriquecimento de IA na Pesquisa de IA do Azure também serão aplicadas. Consulte as notas de transparência para cada serviço para obter mais informações sobre essas limitações.
Limitações técnicas, fatores operacionais e intervalos
Todos os vetores carregados em Pesquisa de IA do Azure devem ser gerados externamente do serviço usando um modelo de sua escolha. É sua responsabilidade considerar as limitações técnicas e os fatores operacionais de cada modelo e se as inserções que ele cria são otimizadas ou até mesmo apropriadas para seu caso de uso. Isso inclui as inferências de significado extraídas do conteúdo e a dimensionalidade do espaço de inserção de vetor.
O modelo de vetorização cria um espaço de inserção que define a experiência de pesquisa do usuário final resultante de um aplicativo. Pode haver desvantagens em um modelo que afeta negativamente a funcionalidade e o desempenho se um modelo não se alinhar bem com um caso de uso desejado ou as inserções geradas forem mal otimizadas.
Embora muitas limitações da pesquisa de vetor sejam provenientes do modelo usado para gerar inserções, há algumas opções adicionais que você deve considerar no momento da consulta. Você pode escolher entre dois algoritmos para determinar a relevância dos resultados da pesquisa vetorial: k-vizinhos mais próximos exaustivo (KNN) ou Mundo Pequeno Navegável Hierárquico (HNSW). O k-vizinhos mais próximos exaustivo (KNN) realiza uma busca exaustiva em todo o espaço vetorial por correspondências mais semelhantes à consulta, calculando as distâncias entre todos os pares de pontos de dados e encontrando os k vizinhos mais próximos exatos de um ponto de consulta. Embora seja mais preciso, esse algoritmo pode ser lento. Se a baixa latência for o objetivo principal, considere usar o algoritmo Hierárquico Navigable Small World (HNSW). O HNSW realiza uma busca eficiente de vizinhos mais próximos aproximados (ANN) em espaços de incorporação de alta dimensão. Consulte a documentação de pesquisa de vetor para obter mais informações sobre essas opções.
Práticas recomendadas para melhorar o desempenho do sistema
- Dedique tempo a realizar testes A/B no seu aplicativo com os diferentes tipos de conteúdos e consultas que você espera que seu aplicativo suporte. Descubra qual experiência de consulta é melhor para suas necessidades.
- Gaste tempo testando seus modelos com uma gama completa de conteúdo de entrada para entender como ele se comporta em muitas situações. Esse conteúdo pode incluir entradas potencialmente confidenciais para entender se há algum viés inerente ao modelo. A visão geral Azure OpenAI Responsável fornece diretrizes sobre como usar a IA de forma responsável.
- Considere adicionar Segurança de Conteúdo de IA do Azure à arquitetura do aplicativo. Ele inclui uma API para detectar imagens ou texto gerados pelo usuário e gerados por IA prejudiciais em aplicativos e serviços.
Avaliando e integrando a pesquisa de vetor para seu uso
Para garantir o desempenho ideal, realize suas próprias avaliações das soluções que você planeja implementar usando a pesquisa de vetor. Siga um processo de avaliação que: (1) utilize algumas partes interessadas internas para avaliar os resultados, (2) utilize experimentação A/B para implementar a busca vetorial para os usuários, (3) incorpore indicadores-chave de desempenho (KPIs) e monitoramento de métricas quando o serviço for implementado nas experiências pela primeira vez e (4) teste e ajuste a configuração do classificador semântico e/ou a definição do índice, incluindo as experiências adjacentes, como o posicionamento da interface do usuário ou os processos de negócios.
Microsoft avaliou rigorosamente a pesquisa de vetores em termos de latência e recall e relevância usando conjuntos de dados diversos para medir a velocidade, a escalabilidade e a precisão dos resultados retornados. O foco principal de seus esforços de avaliação deve ser selecionar o modelo apropriado para seu caso de uso específico, entender as limitações e preconceitos do modelo e testar rigorosamente a experiência de pesquisa de vetor de ponta a ponta.
Limitações técnicas, fatores operacionais e intervalos
Pode haver casos em que resultados semânticos, legendas e respostas podem não parecer corretos. Os modelos usados pelo classificador semântico são treinados em várias fontes de dados (incluindo código aberto e seleções do Microsoft Bing corpus). O classificador semântico dá suporte a uma ampla variedade de idiomas e tenta corresponder consultas de usuário ao conteúdo dos resultados da pesquisa. O classificador semântico também é um recurso premium a um custo adicional que deve ser considerado ao projetar o custo geral da solução de ponta a ponta.
O classificador semântico provavelmente melhorará a relevância em relação ao conteúdo semanticamente rico, como artigos e descrições. Ele busca contexto e relação entre os termos, priorizando as correspondências que fazem mais sentido considerando a consulta. O reconhecimento vocal "localiza" resumos ou legendas e respostas em seu conteúdo, mas ao contrário de modelos generativos como Serviço OpenAI do Azure modelos GPT-3.5 ou GPT-4, ele não os cria. Somente texto verbatim de documentos de origem é incluído na resposta, que pode ser renderizada em uma página de resultados de pesquisa para uma experiência de pesquisa mais produtiva.
Modelos pré-treinados de última geração são usados para resumo e classificação. Para manter o desempenho rápido que os usuários esperam da pesquisa, a soma semântica e a classificação são aplicadas apenas aos 50 principais resultados, conforme pontuado pelo algoritmo de pontuação padrão. As entradas são derivadas do conteúdo no resultado da pesquisa. Ele não pode acessar novamente o índice de pesquisa para acessar outros campos no documento de pesquisa que não foram retornados na resposta da consulta. As entradas estão sujeitas a um comprimento de token de 8.960. Esses limites são necessários para manter os tempos de resposta de milissegundos.
O algoritmo de pontuação padrão é do Bing e Microsoft Research e integrado à infraestrutura Pesquisa de IA do Azure como um recurso de complemento. Os modelos são usados internamente, não são expostos ao desenvolvedor e não são configuráveis. Para obter mais informações sobre a pesquisa e os investimentos em IA que apoiam o ranker semântico, consulte Como a IA do Bing está alimentando Pesquisa de IA do Azure (blog de pesquisa do Microsoft).
O classificador semântico também oferece respostas, legendas e realce dentro da resposta. Por exemplo, se o modelo classificar uma consulta como uma pergunta e tiver 70% confiante na resposta, o modelo retornará uma resposta semântica. Além disso, legendas semânticas fornecem o conteúdo mais relevante dentro dos resultados e fornecem um breve snippet realçando as palavras ou frases mais relevantes dentro desse snippet.
Os resultados do classificador semântico são baseados nos dados no índice de pesquisa subjacente e os modelos fornecem classificação de relevância, respostas e legendas com base nas informações recuperadas do índice. Antes de usar o classificador semântico em um ambiente de produção, é importante fazer mais testes e garantir que o conjunto de dados seja preciso e apropriado para o caso de uso pretendido. Para obter mais informações e exemplos de como avaliar o classificador semântico, consulte o conteúdo e o apêndice aqui.
Desempenho do sistema
Em muitos sistemas de IA, o desempenho geralmente é definido em relação à precisão, ou seja, com que frequência o sistema de IA oferece uma previsão ou saída correta. Com modelos de linguagem natural em larga escala, dois usuários diferentes podem examinar a mesma saída e ter opiniões diferentes sobre o quão útil ou relevante é, o que significa que o desempenho desses sistemas deve ser definido com mais flexibilidade. Aqui, consideramos amplamente o desempenho para significar que o aplicativo é executado como você e seus usuários esperam, incluindo a não geração de saídas prejudiciais.
O classificador semântico foi treinado em conteúdo público. Como resultado, a relevância semântica varia de acordo com os documentos no índice e as consultas emitidas nele. É importante usar seu próprio julgamento e pesquisa quando você usa esse conteúdo para tomar decisões.
Práticas recomendadas para melhorar o desempenho do sistema
- Dedique tempo realizando testes A/B no seu aplicativo com diferentes tipos de consulta, como palavra-chave em comparação com classificador híbrido mais semântico. Descubra qual experiência de consulta é melhor para suas necessidades.
- Dedique um esforço razoável para definir sua configuração semântica de acordo com a documentação da funcionalidade.
- Não confie nas respostas semânticas se você não tiver confiança na precisão das informações no índice de pesquisa.
- Nem sempre confie em legendas semânticas porque elas são extraídas do conteúdo do cliente por meio de uma série de modelos que prevê as respostas mais relevantes em um breve snippet de código.
Avaliação do classificador semântico
Métodos de avaliação
O classificador semântico foi avaliado por meio de testes internos, incluindo julgamento automatizado e humano em vários conjuntos de dados, bem como comentários de clientes internos. O teste inclui a avaliação dos documentos, classificando-os como relevantes ou não relevantes, além de classificá-los em ordem de prioridade de acordo com a relevância. Da mesma forma, as funcionalidades de legendas e respostas também foram classificadas por meio de testes internos.
Resultados da avaliação
Nós nos esforçamos para enviar todas as atualizações de modelo sem regressão (ou seja, o modelo atualizado só deve melhorar o modelo de produção atual). Cada candidato é comparado diretamente ao modelo de produção atual usando métricas adequadas para o recurso que está sendo avaliado (por exemplo,Ganho Cumulativo Descontado Normalizado para classificação e precisão/revocação para respostas). Modelos de classificador semântico são treinados, ajustados e avaliados usando uma ampla gama de dados de treinamento que são representativos de documentos que têm propriedades diferentes (linguagem, comprimento, formatação, estilos e tons) para dar suporte à matriz mais ampla de cenários de pesquisa. Nossos dados de treinamento e teste são extraídos de:
Fontes de documentos:
- Parâmetros de comparação acadêmicos e do setor
- Dados do cliente (somente teste, executados com permissão do cliente)
- Dados sintéticos
Fontes de consultas:
- Conjuntos de consultas de parâmetro de comparação
- Conjuntos de consultas fornecidos pelo cliente (somente teste, executados com permissão do cliente)
- Conjuntos de consultas sintéticas
- Conjuntos de consultas gerados por humanos
Fontes de rótulos para pontuar pares de consultas e documentos:
- Rótulos de referência acadêmicos e industriais
- Rótulos do cliente (somente para testes, realizados com permissão do cliente)
- Rótulos de dados sintéticos
- Rótulos com pontuação humana
Avaliando e integrando o classificador semântico para seu uso
O desempenho do classificador semântico varia dependendo dos usos e condições reais em que as pessoas o usam. A qualidade da relevância fornecida por meio dos modelos de aprendizado profundo que alimentam funcionalidades de ranker semântico está diretamente correlacionada com a qualidade dos dados do índice de pesquisa. Por exemplo, os modelos atualmente têm limitações de token que consideram apenas os 8.960 principais tokens para respostas semânticas. Portanto, se a resposta semântica para uma consulta de pesquisa for encontrada no final de um documento longo (além do limite de token de 8.960), a resposta não será fornecida. A mesma regra se aplica a legendas. Além disso, a configuração semântica lista os campos de pesquisa relevantes em ordem de prioridade. Você pode reordenar os campos nesta lista para ajudar a adaptar a relevância para melhor atender às suas necessidades.
Para garantir o desempenho ideal em seus cenários, os clientes devem realizar suas próprias avaliações das soluções que implementam usando o classificador semântico. Os clientes geralmente devem seguir um processo de avaliação que: (1) usa alguns stakeholders internos para avaliar os resultados, (2) usa a experimentação A/B para distribuir o ranker semântico aos usuários, (3) incorpora KPIs e monitoramento de métricas quando o serviço é implantado em experiências pela primeira vez e (4) testa e ajusta a configuração do ranker semântico e/ou definição de índice, incluindo as experiências ao redor, como o posicionamento da interface do usuário ou os processos de negócios.
Se você estiver desenvolvendo um aplicativo em um domínio ou setor de alto risco, como saúde, recursos humanos, educação ou campo jurídico, avalie o funcionamento do aplicativo em seu cenário, implemente uma forte supervisão humana, avalie o quão bem os usuários entendem as limitações do aplicativo e estejam em conformidade com todas as leis relevantes. Considere outras mitigações com base em seu cenário.
Limitações técnicas, fatores operacionais e intervalos
Podem ocorrer casos em que as consultas sintéticas estejam incorretas, tenham muitas restrições ou sejam muito caras. A reescrita de consulta dá suporte a uma ampla variedade de idiomas e tenta reescrever consultas de usuário para maximizar o recall, é necessário especificar o idioma da consulta como uma entrada. A reescrita de consultas faz parte do Classificador Semântico (recurso da Pesquisa de IA do Azure para melhorar a relevância da pesquisa), que é um recurso premium com um custo adicional. Isso deve ser considerado ao projetar as despesas gerais da sua solução de ponta a ponta. A reescrita de consulta só poderá ser usada se você tiver o classificador semântico habilitado.
Antes de usar a reescrita de consulta em um ambiente de produção (versão dinâmica do aplicativo), é importante fazer testes adicionais e garantir que as consultas sintéticas sejam apropriadas para o caso de uso pretendido. Para obter mais informações e exemplos de como avaliar a reescrita de consulta, consulte o conteúdo e o apêndice aqui.
Desempenho do sistema
Com modelos de linguagem natural em larga escala, dois usuários diferentes podem examinar a mesma saída e ter opiniões diferentes sobre o quão útil ou relevante é, o que significa que o desempenho desses sistemas deve ser definido com mais flexibilidade. Aqui, consideramos amplamente o desempenho para significar que o aplicativo é executado como você e seus usuários esperam, incluindo a não geração de saídas prejudiciais.
O desempenho da reescrita de consulta varia dependendo dos usos reais e das condições em que as pessoas a usam. A qualidade das consultas sintéticas fornecidas pelo modelo de reescrita de consulta está diretamente correlacionada com a consulta de pesquisa original.
Para garantir o desempenho ideal em seus cenários, os clientes devem realizar suas próprias avaliações das soluções que implementam usando a reescrita de consulta. Os clientes geralmente devem seguir um processo de avaliação que:
- usa algumas partes interessadas internas para avaliar os resultados,
- Utiliza experimentação A/B para implementar a reescrita de consultas para os usuários, e
- incorpora KPIs e monitoramento de métricas quando o serviço é implantado em experiências pela primeira vez
Práticas recomendadas para melhorar o desempenho do sistema
- Conclua o teste A/B para seu aplicativo com diferentes tipos de consulta (texto completo, vetor, híbrido ou outro tipo de consultas). Descubra qual experiência de consulta é melhor para suas necessidades.
- Nem sempre suponha que cada consulta sintética gerada pela reescrita de consulta refletirá a intenção exata da consulta original. As consultas sintéticas são geradas por um SLM ajustado, que gera consultas semanticamente semelhantes à intenção da consulta original, mas podem não corresponder à intenção exata.
Avaliação da reescrita de consulta
Métodos de avaliação
A reescrita de consulta foi avaliada por meio de testes internos, incluindo julgamento automatizado e humano em vários conjuntos de dados, bem como comentários de clientes internos. Os testes incluíram a avaliação da relevância dos resultados da classificação semântica combinada com a reescrita de consulta em comparação com a relevância dos resultados apenas com classificação semântica.
Resultados da avaliação
Cada modelo candidato é comparado diretamente ao modelo implantado no momento usando métricas adequadas para o recurso que está sendo avaliado. Os modelos de reescrita de consulta são ajustados e avaliados usando uma ampla gama de dados públicos que representam consultas que têm propriedades diferentes (idioma, comprimento, formatação, estilos e tons) para dar suporte à matriz mais ampla de cenários de pesquisa. Nossos dados de treinamento e teste são extraídos de:
Fontes de documentos:
- Parâmetros de comparação acadêmicos e do setor
- Dados do cliente (somente teste, executados com permissão do cliente)
Fontes de consultas:
- Conjuntos de consultas de parâmetro de comparação
- Conjuntos de consultas fornecidos pelo cliente (somente teste, executados com permissão do cliente)
- Conjuntos de consultas sintéticas
- Conjuntos de consultas gerados por humanos
Fontes de rótulos para pontuar pares de consultas e documentos:
- Rótulos de referência acadêmicos e industriais
- Rótulos do cliente (somente para testes, realizados com permissão do cliente)
- Rótulos de dados sintéticos
- Rótulos com pontuação humana
Avaliação e integração da reescrita de consultas para seu uso
Como a reescrita de consultas foi treinada em conteúdo público, as consultas sintéticas variarão de acordo com as consultas emitidas para ela. Portanto, é importante usar seu próprio julgamento e pesquisa quando você usa esse conteúdo para tomar decisões.
Limitações técnicas, fatores operacionais e intervalos
Embora a habilidade do Prompt do GenAI ofereça funcionalidades avançadas, é essencial reconhecer determinadas limitações:
- A habilidade depende de filtros de conteúdo configurados pelo cliente no Foundry. Pesquisa de IA do Azure não fornece mecanismos adicionais de segurança de conteúdo para essa habilidade.
- A qualidade do conteúdo gerado por IA depende da eficácia dos prompts e do modelo de linguagem subjacente. O teste completo é necessário para garantir que a saída atenda aos padrões desejados.
- O processamento de grandes volumes de dados com prompts complexos pode exigir recursos computacionais significativos e pode causar latência. Planeje e aloque recursos com sabedoria para não apenas manter o desempenho e a eficácia, mas também para evitar possíveis atrasos no processamento de dados.
Desempenho do sistema
Práticas recomendadas para melhorar o desempenho do sistema
Para otimizar o desempenho da habilidade de Prompt do GenAI:
- Utilize a ferramenta debug sessions do Pesquisa de IA do Azure para testar prompts em documentos de exemplo, garantindo que o conteúdo gerado por IA se alinhe às expectativas antes da implantação completa.
- Crie prompts claros e detalhados para orientar o modelo de linguagem efetivamente, reduzindo a probabilidade de saídas irrelevantes ou imprecisas.
- Monitore o desempenho do sistema e dimensione os recursos conforme necessário para lidar com as demandas computacionais do processamento de IA.
- Incentivar a supervisão humana dos resultados antes da publicação ou disseminação. Com a IA generativa, há potencial para gerar conteúdo que pode ser ofensivo ou irrelevante para a tarefa em questão.
Avaliação da habilidade GenAI Prompt
Avaliação e integração da habilidade GenAI Prompt para seu uso
Para maximizar os benefícios da habilidade do Prompt do GenAI em seu contexto específico, considere as seguintes etapas:
- Determine as metas de enriquecimento específicas, como gerar resumos concisos, extrair entidades-chave ou criar metadados descritivos, para alinhar o aplicativo da habilidade às suas necessidades comerciais.
- Comece com um subconjunto de seus dados para avaliar o desempenho da habilidade e fazer os ajustes necessários. Essa abordagem permite experimentação e refinamento controlados antes da implantação em grande escala.
- Estabeleça mecanismos para monitorar a qualidade e o impacto do conteúdo gerado por IA. Solicite comentários dos usuários finais para identificar áreas de melhoria e garantir que os dados enriquecidos atendam às expectativas do usuário.
Limitações técnicas, fatores operacionais e intervalos
Pode haver casos em que as subconsultas geradas pelo LLM sejam irrelevantes, excessivamente restritivas ou elevem os custos de tokens. A recuperação orientada por agentes dá suporte a todos os idiomas tratados pela família GPT-4o, mas a qualidade do plano de consulta gerado ainda depende da clareza da entrada do usuário. Como a recuperação agentiva depende do classificador semântico para cada subconsulta, você deve ter o classificador semântico habilitado no índice. O classificador semântico é um recurso premium baseado em token; embora os encargos de classificação sejam dispensados durante a fase inicial da visualização pública, eles serão aplicados posteriormente e deverão ser incluídos no custo total de posse.
Antes de mover a recuperação agêncica para um ambiente de produção, realize testes adicionais para confirmar se as subconsultas e as passagens retornadas são apropriadas para o caso de uso pretendido, que a latência e o custo atendem aos seus objetivos de nível de serviço, e que os dados de base não expõem conteúdo confidencial ou não conforme.
Desempenho do sistema
Assim como acontece com qualquer sistema de modelo de linguagem em larga escala, diferentes usuários podem alcançar julgamentos diferentes sobre a utilidade ou relevância das passagens retornadas, portanto, o desempenho deve ser definido de forma flexível. Para recuperação agencial, consideramos que um bom desempenho significa que o aplicativo de ponta a ponta fornece o conteúdo esperado pelos seus usuários, sem latência, custo ou saídas prejudiciais que sejam inaceitáveis.
A eficácia da recuperação agêntica depende de muitos fatores do mundo real.
- Comprimento do prompt/histórico do chat
- Número de subconsultas geradas por LLM
- Tamanho e esquema do índice (palavra-chave, vetor, híbrido)
- Escolha do modelo de planejamento (GPT-4o vs. GPT-4o-mini)
- Configuração de pesquisa semântica e limites de pontuação
Práticas recomendadas para melhorar o desempenho do sistema
- Resuma ou corte as interações mais antigas do chat para manter o uso de tokens baixo.
- Ajustar o limite do ranker para que apenas passagens altamente relevantes sejam retornadas
- Usar filtros sempre que possível
Avaliação da recuperação agentiva
A recuperação agentiva foi avaliada por meio de testes internos, incluindo julgamento automatizado e humano em vários conjuntos de dados. Os testes incluíram a avaliação da relevância dos resultados da recuperação agentiva em comparação com os resultados obtidos apenas com a classificação semântica.
Métodos de avaliação
Cada configuração de recuperação por meio de agentes candidatos, definida por seu prompt do planejador, variante do modelo, contagem de subconsultas e limites de classificação, é avaliada frente a frente em relação à linha de base de produção. Aplicamos um conjunto de métricas de relevância, segurança, latência e custo escolhidas especificamente para cenários de recuperação de várias consultas. Para garantir a confiabilidade em casos de uso do mundo real, o ajuste e o teste são executados em uma ampla combinação de conjuntos de dados públicos e aprovados pelo cliente que variam em idioma, comprimento da consulta, formatação, estilo e tom de conversação. O material de teste é originado de:
Fontes de documentos:
- Parâmetros de comparação acadêmicos e do setor
- Dados do cliente (somente teste, executados com permissão do cliente)
- Fontes de consultas:
- Conjuntos de consultas de parâmetro de comparação
- Conjuntos de consultas fornecidos pelo cliente (somente teste, executados com permissão do cliente)
- Conjuntos de consultas sintéticas
- Conjuntos de consultas gerados por humanos
Fontes de rótulos para pontuar pares de consultas e documentos:
- Rótulos de referência acadêmicos e industriais
- Rótulos do cliente (somente para testes, realizados com permissão do cliente)
- Rótulos de dados sintéticos
- Rótulos com pontuação humana
Avaliando e integrando a recuperação baseada em agentes para seu uso
Como o planejador de recuperação agente é treinado em grande parte em dados públicos, a qualidade e a relevância de suas subconsultas geradas variarão conforme seu domínio e os prompts de usuário específicos. Para maximizar os benefícios da recuperação agêntica no seu contexto específico, considere as seguintes etapas:
- Valide a saída antes de usá-la para conduzir decisões críticas aos negócios: inspecione manualmente uma amostra de subconsultas geradas e documentos retornados para confirmar que estão alinhados com os requisitos de terminologia, precisão e conformidade do domínio.
- Forneça informações específicas do domínio ao planejador. Forneça mapas de sinônimos e histórico completo de conversa para que o LLM possa parafrasear e decompor consultas em linguagem que corresponda ao conteúdo, melhorando o recall e a precisão.
- Implementar a lógica de fallback ou de guarda-corpo: se o planejador produzir subconsultas de baixa confiança ou fora do escopo, encaminhe a solicitação para uma pesquisa por palavra-chave ou por vetor mais simples, ou exiba um prompt de esclarecimento para o usuário, impedindo que respostas não confiáveis se propaguem nas etapas subsequentes.
Saiba mais sobre IA responsável
- princípios de IA Microsoft
- Recursos responsáveis de IA da Microsoft
- Microsoft Azure Cursos de aprendizagem sobre IA responsável
Saiba mais sobre Pesquisa de IA do Azure
Comentários
Esta página foi útil?
No
Precisa de ajuda com este tópico?
Quer experimentar o Pergunte e aprenda para esclarecer ou guiar você neste tópico?
Recursos adicionais
-
Last updated on
2026-04-27