Jump to content

Pessoas leitoras/Recuperação de informações/Fase 0

From mediawiki.org
This page is a translated version of the page Readers/Information Retrieval/Phase 0 and the translation is 100% complete.

Fase 0: Validação da ideia

A Fundação está realizando uma análise inicial para entender melhor por que as pessoas leitoras acham mais fácil encontrar informações da Wikipédia em outros lugares do que na própria Wikipédia, e como melhorar a descoberta de informações, mantendo-se fiel ao conhecimento verificável e impulsionado pela comunidade.

Esta fase está focada em identificar se o problema é real, esclarecer as suposições por meio de dados e perspectivas da comunidade e compreender nossas capacidades e limitações técnicas.

Mais especificamente, esta análise tem como objetivo responder às seguintes perguntas:

  • Por que as pessoas leitoras acham mais fácil encontrar informações da Wikipédia em outros lugares do que na própria Wikipédia?
  • Quais são as expectativas das pessoas leitoras de hoje ao buscar informações?
  • Como a procura por respostas pode ser melhorada na Wikipédia, preservando a verificabilidade e as normas da comunidade?

Objetivos

  • Determinar se e em que medida as pessoas leitoras enfrentam dificuldades reais para encontrar informações na Wikipédia.
  • Avaliar as perspectivas da comunidade e determinar conceitos que valem a pena testar em produção.
  • Definir métodos oportunos, porém impactantes, para melhor atender às necessidades das pessoas leitoras.
  • Verificar a viabilidade de protótipos simplificados que estejam em conformidade com a infraestrutura e os padrões de privacidade da Wikimedia.

Possíveis hipóteses a serem avaliadas

  • As pessoas leitoras desejam digitar suas consultas e receber resultados que vão além da simples correspondência de palavras-chave.
  • Exibir trechos e snippets de seções pode ser mais satisfatório do que incluir links apenas para artigos completos.
  • Apresentar perguntas derivadas do artigo pode melhorar o engajamento, direcionando as pessoas leitoras para seções relevantes e incentivando uma exploração mais aprofundada de tópicos relacionados de forma mais intuitiva.

Ações que estão sendo tomadas

A partir de outubro de 2025, estamos tomando as seguintes medidas para compreender e compartilhar insights neste espaço de problemas:

  • Revisando pesquisas anteriores relacionadas as frustrações com a experiência de busca na Wikipédia por parte das pessoas leitoras.
  • Analisando a frequência com que perguntas em linguagem natural aparecem nos registros de pesquisa.
  • Comparando como os resultados semânticos e por palavras-chave são percebidos por meio de mockups conceituais.
  • Coletando feedback qualitativo de novas pessoas leitoras sobre a exibição de trechos versus links para o artigo completo ao retornar resultados para consultas por meio de mockups conceituais.
  • Coletando feedback qualitativo sobre a facilidade de encontrar informações
  • Avaliando a viabilidade da infraestrutura para modificações na recuperação de resultados de busca.
  • Desenvolvendo protótipos internos em pequena escala para compreender uma variedade de abordagens e limitações técnicas
    • Observação: esses protótipos são apenas exploratórios e não estão em condições de serem colocados em produção para pessoas usuárias reais.
  • Colaborando com a comunidade para refinar o espaço de problemas.

Objetivo desta fase

Os conceitos e hipóteses aqui apresentados têm como objetivo estimular o debate e orientar decisões futuras. O objetivo da Fase 0 é identificar e testar, de forma colaborativa, oportunidades que possam fortalecer o papel da Wikipédia como destino e espaço de descoberta de informações confiáveis.

Relatório: Melhorando a forma como as pessoas leitoras encontram informações na Wikipédia

Síntese dos resultados

Sinal geral

A síntese a seguir resume as principais aprendizagens sobre o sistema de busca da Wikipédia em diversas disciplinas. Com base nesta pesquisa, as evidências indicam que o sistema de busca atual da Wikipédia apresenta um desempenho inferior às expectativas das pessoas leitoras modernas quando utilizam consultas semânticas e consultas em linguagem natural.

Neste relatório, definimos a recuperação semântica como a recuperação de informações com base no significado, nos conceitos ou nas relações contextuais de uma busca, e a recuperação lexical como a recuperação de informações com base em palavras exatas, como a correspondência de palavras-chave.

A recuperação de informações assistida por semântica, baseada em conteúdo criado por humanos, pode melhorar a satisfação da pessoa leitora e o sucesso da tarefa. Embora cada equipe tenha abordado o problema sob uma ótica diferente, os resultados coletivos apontam para um valor claro para a pessoa leitora, uma comunidade aberta para tal e viabilidade técnica de um experimento em pequena escala com um produto mínimo viável (MVP, na sigla em inglês) de busca híbrida (ou seja, uma combinação de busca semântica e lexical), desde que a implementação permaneça transparente, centrada no ser humano, iterativa e baseada no design.

Dependendo dos resultados do MVP e das conclusões das discussões com a comunidade, determinaremos a conveniência de desenvolver uma funcionalidade permanente. Se decidirmos seguir em frente, trabalharemos em colaboração com a comunidade para determinar como essa funcionalidade deve ser.

Principais resultados de diversos projetos de pesquisa

É importante ressaltar que as pesquisas preliminares foram realizadas em inglês.

Tema Evidências em diversas disciplinas
As pessoas leitoras desistem quando a descoberta parece ineficiente. A revisão da literatura e os estudos de design confirmam que a maioria das sessões consiste em visitas de uma única página; as pessoas usuárias habitualmente realizam novas buscas externamente.
A recuperação híbrida oferece o melhor equilíbrio entre experiência da pessoa usuária e abrangência. Provas de conceito de dados e investigações de busca mostram que a recuperação semântica não é suficiente como experiência isolada; a recuperação lexical ainda é necessária (e pode ser ainda mais otimizada) para certos tipos de consultas.
As melhorias na experiência da pessoa usuária são tão importantes quanto as melhorias no modelo. As provas de conceito de design mostram que a forma como os resultados são apresentados (snippets âncora, proveniência clara) continua a ser o mais importante, independentemente dos resultados apresentados.
A comunidade está cautelosamente otimista. As discussões na WikiCon North America e no ENWP Discord revelam interesse na modernização da busca, especialmente no sentido de combater o declínio do número de pessoas leitoras e priorizar a descoberta de conteúdo gerado por humanos. É preciso realizar discussões com um grupo mais amplo e representativo de pessoas voluntárias.
A confiança depende da transparência, não de isenções de responsabilidade. Os resultados das entrevistas com pessoas usuárias de busca de perguntas e respostas e de busca semântica mostraram que as pessoas usuárias ficavam confusas quando a funcionalidade tentava sinalizar a IA, seja por meio de um rótulo ou ícone de divulgação.
Ainda existem lacunas na avaliação. Todas as equipes observam a ausência de uma referência unificada e multilíngue ou de métricas de sucesso detalhadas para um possível produto final.

Conclusão estratégica

A Fase 0 estabelece que a busca interna deve evoluir da simples recuperação de informações usando palavras-chave para também oferecer suporte à descoberta consciente da intenção; ou seja, um modelo de busca capaz de compreender o significado mais profundo de uma consulta para direcionar as pessoas leitoras às respostas que procuram.

Também queremos aproveitar a oportunidade para explorar os benefícios e riscos de diferentes modelos de busca, incluindo aqueles que utilizam LLMs.

A maneira mais rápida de entender como aprimorar a busca na wiki seria por meio de um experimento em pequena escala com um MVP para validar hipóteses de experiência da pessoa usuária, coletar dados de referência e definir as decisões de infraestrutura necessárias para uma busca híbrida sustentável e confiável em todo o ecossistema da Wikimedia.

Análise da pesquisa por disciplina

Cada subseção resume os métodos, os principais resultados e as evidências representativas.

Revisão da literatura realizada pela equipe de pesquisa

Pesquisa realizada por Martin Gerlach, pesquisador sênior da Equipe de Pesquisa .

Hipótese: Se analisarmos as pesquisas existentes sobre como as pessoas leitoras interagem com as ferramentas de busca e navegação na Wikipédia, e como usam a busca externa para encontrar conhecimento na Wikipédia, seremos capazes de fornecer às equipes de Pessoas leitoras ≥3 recomendações e resultados práticos que as ajudem a definir um MVP de busca e descoberta para abordar lacunas nas expectativas e necessidades das pessoas leitoras.

Status: Comprovada.

Métodos e contribuições:

  • Síntese de estudos da Wikimedia e externos sobre: ​​uso e consultas de busca interna, referências de busca externa, experimentos de busca semântica e barreiras conhecidas de experiência da pessoa usuária.
  • Análise do comportamento de busca por texto completo versus autocompletar, resultados nulos e abandono, casos de uso multilíngues e fora do espaço de nomes principal, e busca de mídia no Commons.

Principais resultados:

  • A busca interna é subutilizada e tendenciosa por parte das pessoas editoras.
    • Apenas cerca de 0,8 a 2% das visualizações de páginas têm origem em buscas internas; 4 a 12% das pessoas usuárias do site utilizam a busca, com as pessoas editoras estando super-representadas entre aquelas pessoas que utilizam a busca. Muitas sessões são visitas de uma única página.
  • O preenchimento automático domina o comportamento.
    • Cerca de 80 a 95% das sessões de busca dependem do preenchimento automático; somente 5 a 8% são apenas de texto completo. A satisfação e a taxa de cliques (CTR, na sigla em inglês) são muito maiores para o preenchimento automático do que para o texto completo.
  • Consultas em linguagem natural são pouco comuns.
    • Estima-se que representem cerca de 4 a 7% das consultas de texto completo na wiki; referências externas contendo palavras de perguntas explícitas também parecem representar uma parcela muito pequena. Algumas pessoas usuárias esperam que frases mais longas e naturais funcionem.
  • As pessoas usuárias enfrentam barreiras de descoberta e compreensão.
    • Muitas pessoas leitoras não percebem que Special:Search realiza buscas de texto completo; a ausência de sugestões de preenchimento automático é interpretada erroneamente como falta de abrangência, causando saídas prematuras. Os pontos de entrada e as affordances do texto completo estão ocultos/pouco claros.
  • A busca externa é habitual e utilizada para navegação.
    • As pessoas leitoras frequentemente recorrem a mecanismos de busca externos (especialmente o Google) para navegar entre as páginas da Wikipédia, mesmo quando existem links azuis na própria wiki. A conveniência e o hábito desempenham papéis importantes.
  • Commons e espaços de nomes não principais são pontos problemáticos.
    • A precisão da busca no Commons é baixa (especialmente para idiomas que não o inglês); as pessoas editoras solicitam uma busca melhor para templates, ajuda/políticas e tópicos de discussão.
  • Nenhum método de recuperação isolado é globalmente superior.
    • Os modelos lexicais e semânticos têm pontos fortes; o que importa é adequar o método à consulta e à intenção da pessoa usuária. Modelos híbridos que utilizam a recuperação lexical com reclassificação semântica provavelmente oferecerão o melhor equilíbrio entre relevância e eficiência.
  • Existem lacunas na avaliação.
    • Não temos uma referência confiável e representativa de consultas/trechos para comparar modelos e quantificar melhorias de relevância.

Recomendações de curto prazo:

  • R1 — Criar um loop de benchmark e avaliação.
    • Criar um conjunto de consultas representativo e multilíngue com trechos relevantes anotados; cobrir casos de uso de pessoas leitoras e editoras Estabelecer uma avaliação contínua offline/online (A/B, intercalada) para comparar variantes lexicais, híbridas e semânticas. T406207
  • R2 — Melhorar a interface do usuário e as affordances da busca agora.
    • Esclarecer a relação entre preenchimento automático e texto completo; evitar a armadilha de "sem sugestão = sem cobertura"; adicionar pontos de entrada mais claros para resultados em nível de seção e entre espaços de nomes.
  • R3 — Aplicar recuperação híbrida.
    • Usar componentes semânticos seletivamente — por exemplo, para reclassificar os principais resultados lexicais, recuperar trechos dentro de artigos ou em domínios sem metadados de texto (por exemplo, Commons através de modelos de linguagem visual). Isso equilibra capacidade e custo sem sobrevalorizar as preocupações com infraestrutura nesta fase.

Recomendações de médio prazo:

  • R4 — Aprimorar consultas dentro da pilha (stack em inglês) atual.
    • Utilizar a reformulação/aprimoramento de consultas (detecção de entidades, expansão de aliases, ortografia/lematização) para melhorar frases longas/naturais sem infraestrutura semântica completa.
  • R5 — Fortalecer a descoberta multilíngue.
    • Melhorar a visualização entre idiomas através de etiquetas/aliases do Wikidata; considerar a integração com o MinT para pessoas leitoras (com opção de adesão), especialmente para públicos monolíngues.

Conceitos de design

Pesquisa realizada por Tais Lessa, designer-chefe de UX da Equipe de Aplicativos , e Justin Scherer, designer-chefe de UX da equipe Crescimento de Leitores .

Hipótese: Se apresentarmos conceitos de design de alta fidelidade para a descoberta de conteúdo por meio de busca semântica a 10-20 pessoas leitoras ocasionais da Wikipédia em um estudo qualitativo, observaremos uma reação positiva em relação a funcionalidade e ganharemos a confiança necessária para prosseguir com um MVP de busca e descoberta que se baseia em trechos curtos escritos por humanos para consultas de busca.

Status: Comprovada.

Objetivo: Foram realizadas duas análises conceituais complementares para entender como a Wikipédia pode evoluir sua experiência de busca de informações na plataforma: uma focada na busca semântica iniciada pela pessoa usuária (ajudando as pessoas leitoras a encontrar respostas de forma mais eficiente por meio de buscas na wiki) e outra em interfaces de perguntas e respostas (ajudando as pessoas leitoras a reconhecer o que uma página pode responder por meio de métodos descontraídos/passivos de descoberta de informações).

Estas foram análises paralelas, e não um teste comparativo. Cada conceito contribui para uma camada diferente da jornada da pessoa leitora e provavelmente será explorado em sequência, em vez de competir uns com os outros.

Conceito A – Busca Semântica

Hipótese: A exibição de snippets âncora e em nível de seção será mais satisfatória do que links para artigos completos.

Metodologia: Quatro estudos realizados em dispositivos móveis (n = 20; com uma mistura de pessoas leitoras ocasionais e frequentes) compararam a experiência atual baseada em palavras-chave com dois protótipos (visualize em um navegador móvel).

GIF do protótipo de busca semântica, mostrando a pergunta completa, sugestões de busca empilhadas e resultados no artigo.

Principais resultados:

  • Principal hipótese validada.
    • 17 dos 20 (85%) participantes do teste preferiram trechos de seções específicas em vez de links para páginas inteiras.
  • Discrepância entre as expectativas e a busca atual.
    • A experiência atual é precisa, mas lenta para obter informações; as pessoas leitoras esperam respostas rápidas e diretas, com opções de aprofundamento.
  • O Conceito 1 teve um desempenho superior ao Conceito 2 em termos de clareza, velocidade e confiabilidade.
    • As pessoas leitoras apreciaram a ancoragem direta e o destaque dentro do artigo; 11 das 20 elogiaram essa affordance.
  • Criar sentido (sense-making em inglês) requer clareza, não apenas classificação.
    • As pessoas usuárias examinam rapidamente snippets para se orientarem.
  • Algumas pessoas participantes atribuíram erroneamente snippets como gerados por IA, ressaltando a necessidade de uma etiquetagem transparente de proveniência, mas muitas pessoas participantes relataram que gostariam de ver mais ferramentas de IA integradas à Wikipédia.

Conceito B — Interfaces de perguntas e respostas

Hipótese: Adicionar módulos de "Respostas neste artigo" e pré-visualizações de páginas expandidas ajudará as pessoas leitoras a encontrar informações específicas mais rapidamente, ao mesmo tempo em que esclarece o que uma página pode responder.

Metodologia: Três estudos não moderados (n = 30; pessoas leitoras "inativas/antigas") testaram:

  • Acordeões (perguntas e respostas incorporadas)
  • Links diretos (ir para seções ancoradas)
  • Pré-visualizações de páginas ampliadas (cartões flutuantes (hover cards, em inglês) maiores)
Um exemplo de um potencial design de perguntas e respostas em estilo acordeão.

Principais resultados:

  • Recepção geral positiva.
    • Todos os conceitos aumentaram a percepção da eficiência do conteúdo ("100% útil para quem não quer ler o artigo inteiro").
  • Os acordeões e os links diretos tornaram a Wikipédia mais dinâmica e interativa (“focalizar”, “rápido”, “ágil”).
    • Os acordeões correm o risco de serem vistos como becos sem saída sem affordances explícitas de «Visualizar no artigo».
  • As divulgações confundiram as pessoas usuárias.
    • O ícone do robô e a etiqueta de IA não conseguiram esclarecer o que era gerado por máquina e o que era gerado por humanos, e acabaram aumentando a confusão.
  • A relevância da pergunta é a dependência crítica.
    • Quando as perguntas correspondiam às necessidades das pessoas usuárias, a satisfação era alta; caso contrário, a utilidade diminuía.
  • As pré-visualizações de página expandidas reduziram a sobrecarga de abas, mas mas podem causar distração quando há muitas presentes.
  • Embora as perguntas tenham sido geradas por IA, as pessoas participantes frequentemente presumiam que elas eram provenientes de crowdsourcing ou selecionadas por pessoas editoras.
    • As pessoas participantes compreenderam corretamente que as respostas não foram geradas por IA.
  • As pessoas leitoras "ocasionais" deste coorte tendiam a se identificar como antigas pessoas leitoras que agora dependem das ferramentas da GenAI, sugerindo que perguntas e respostas poderia reconquistar esse grupo.

Conclusões combinadas:

  • Necessidades da pessoa usuária:
    • Busca Semântica - Respostas mais rápidas e claras dentro do fluxo de busca
    • Interfaces de perguntas e respostas - Dicas contextuais sobre “o que esta página pode responder”
  • Público-alvo principal:
    • Busca semântica: Pessoas leitoras e realizadoras de buscas ativas
    • Interface de perguntas e respostas: Pessoas leitoras inativas ou ocasionais
  • Interação central:
    • Busca semântica: consulta → trechos classificados
    • Perguntas e respostas: interface: navegação → perguntas apresentadas
  • Dependência:
    • Busca semântica: recuperação confiável (modelo híbrido)
    • Interface de perguntas e respostas: geração confiável de perguntas
  • Risco de transparência da IA
    • Busca semântica: as pessoas usuárias podem interpretar erroneamente snippets gerados por humanos como se fossem gerados por IA.
    • Interface de perguntas e respostas: as pessoas usuárias interpretam erroneamente os ícones de divulgação e acreditam que o conteúdo gerado por humanos é IA.
  • Criar viabilidade
    • Pesquisa semântica: risco menor a curto prazo
    • Interface de perguntas e respostas: requer maturidade do modelo + salvaguardas de design

Feedback da comunidade

Pesquisa realizada por Eliza Blackorby, especialista em comunicação de movimento nas equipes de Crescimento do Público Leitor e Experiência do Leitor .

Engajamento inicial na wiki:

Uma página do projeto foi criada para descrever o contexto, o raciocínio e os primeiros resultados da pesquisa para a iniciativa. Isso serve como um espaço transparente para pessoas editoras e leitoras acompanharem o progresso, discutirem questões em aberto e compartilharem perspectivas sobre os desafios da descoberta de informações.

Engajamento presencial inicial:

Na WikiCon North America (outubro de 2025), apresentamos uma palestra relâmpago discutindo:

  • Como funciona a busca atual da Wikipédia e quais são suas lacunas em relação às expectativas modernas.
  • Avaliações iniciais da busca semântica
  • Oportunidades para o envolvimento da comunidade

Em uma teleconferência da comunidade realizada em dezembro com membros do Discord da Wikipédia em inglês, Jazmin Tanner e Tais Lessa apresentaram parte da pesquisa detalhada neste relatório, bem como ideias de design em fase inicial.

Essas sessões incentivaram perguntas, feedback e discussões sobre o futuro da descoberta de conteúdo na wiki.

Principais resultados:

  • Os membros da comunidade estão cientes e preocupados com o declínio do número de pessoas leitoras na wiki.
  • Pessoas editoras comentaram que muitas pessoas leitoras, incluindo pessoas amigas, familiares e colegas, agora recorrem a chatbots de IA para obter respostas rápidas, o que levanta preocupações sobre a visibilidade da Wikipedia.
  • Inúmeras vezes, as pessoas editoras compartilharam histórias de frustração com o conteúdo da Wikipédia sendo usado sem atribuição e os mecanismos de busca extraindo informações da Wikipédia, de modo que as pessoas leitoras não acessam mais o artigo diretamente.
  • Participantes se entusiasmaram com a ideia da busca semântica como uma solução potencial para reconquistar as pessoas leitoras e, possivelmente, incentivar a adesão de novas pessoas editoras no futuro.
  • Os membros da comunidade entenderam que a busca semântica utilizará ferramentas de IA/Aprendizado de máquina para tornar a busca mais moderna e relevante.
  • Membros da comunidade expressaram preocupação com a criação de incentivos para que as pessoas editoras "otimizem" artigos para visibilidade na busca, bem como possíveis receios em relação às ferramentas de IA generativa.
  • Os membros da comunidade veem potencial nas perguntas e respostas para ajudar a redirecionar as pessoas leitoras que chegam com consultas não enciclopédicas, de forma semelhante à forma como as páginas de desambiguação redirecionam a ambiguidade dos tópicos.
  • É necessário desenvolver uma maneira adequada à Wikipédia para redirecionar as pessoas leitoras que fazem perguntas que a Wikipédia não pode responder, ou seja, “comunicar isto de forma delicada”.
  • Quem contribui para artigos pode fornecer metadados ou anotações que melhoram a relevância da busca semântica.
  • Outras ideias incluíam:
    • Uso de uma pontuação de confiança interna para avaliar o quão bem uma pergunta se relaciona com o conteúdo, e apenas as respostas acima de um limite definido são exibidas.
    • Considerar a possibilidade da busca dentro do artigo, alimentada por aprendizado de máquina (buscando dentro da página), em vez de colocar caixas de perguntas e respostas no topo dos artigos, ao estilo do Google.
    • Permitir a possibilidade de combinar busca por correspondência exata e busca semântica em uma única consulta.

Conclusões:

  • Continuaremos a compartilhar nossas ideias sobre busca semântica desde o início e com frequência, tanto em conversas na wiki quanto em eventos presenciais da comunidade.
  • Comunidades do mundo todo nos ajudarão a transformar nossas aprendizagens em uma funcionalidade de busca que funcione bem, atenda às necessidades das pessoas leitoras e seja fiel à Wikipédia.
  • Trabalharemos com comunidades wiki em todo o mundo para garantir que as soluções de pesquisa semântica na Wikipédia sejam adequadas e eficazes tanto do ponto de vista multilíngue quanto multicultural.
  • A busca semântica e as funcionalidades relacionadas não serão implementadas sem o envolvimento e consenso da comunidade.

Protótipo de dados de aprendizado de máquina

A pesquisa foi realizada pela equipe Aprendizado de Máquina , com contribuições de Fabian Kaelin, engenheiro de pesquisa, e Santhosh Thottingal, engenheiro de software, e liderada por Sucheta Salgaonkar, gerente líder de produtos de IA.

Hipótese: Se produzirmos um protótipo interno para busca semântica e perguntas e respostas dentro do artigo, apresentado como uma interface de demonstração que contrasta a abordagem atual com novas abordagens exploratórias, as equipes de Pessoas leitoras poderão avaliar qualitativamente o desempenho de cada abordagem em diferentes jornadas da pessoa usuária e identificar lacunas ou oportunidades para novas iterações.

Status: Comprovada.

Metodologia: A equipe de aprendizado de máquina explorou várias implementações de protótipos: busca de similaridade baseada em incorporação, correspondência e recuperação de perguntas, e geração e pontuação de LLM para perguntas de artigos.

Protótipos: Esses protótipos foram construídos com o objetivo de agilizar o processo e não com base na abordagem “ideal”:

Pontos a considerar:

  • A recuperação híbrida é essencial.
    • A recuperação semântica por si só tem um desempenho inferior para a maioria das consultas lexicais; é necessário combinar a recuperação lexical com a reclassificação semântica para obter um alto nível de satisfação.
  • Compensações de granularidade
    • Existe um equilíbrio entre custo e precisão entre as incorporações em nível de artigo, seção e parágrafo. São necessárias mais pesquisas sobre chunking e arquiteturas alternativas (por exemplo, modelos de realce semântico) para melhorar a eficiência.
  • Preparação da infraestrutura
    • Um MVP pronto para produção requer pipelines escaláveis ​​para geração, atualização e armazenamento de incorporação. A capacidade atual suporta testes em escala limitada, mas não ciclos de atualização contínuos.
  • A escolha do modelo é importante.
    • Os modelos de incorporação variam em desempenho; uma gama mais ampla de modelos deve ser analisada e as opções de código aberto e da versão nativa de OpenSearch devem ser comparadas. Sistemas de múltiplas passagens com reclassificadores podem mitigar problemas de dimensionalidade e desempenho.
  • Riscos de viés e alucinação
    • Para casos de uso de perguntas e respostas, as perguntas geradas por IA podem potencialmente introduzir viés factual ou representacional. Essa geração por parte da IA deve ocorrer offline, com validação humana antes da implementação.
  • Novas métricas de sucesso são necessárias.
    • As métricas tradicionais de cliques não registram quando as pessoas usuárias encontram respostas sem clicar. Introduzir o “bom abandono” e a avaliação humana para medir melhor a qualidade da busca.

O que seria necessário para a produção em escala:

Para avançar de um protótipo interno para uma fase de produção em grande escala, os seguintes componentes são necessários:

  • Infraestrutura de incorporação: pipeline escalável para gerar, atualizar e armazenar incorporações de texto em várias wikis.
  • Serviço de busca híbrida: melhores caminhos e tratamento para consultas de vários tipos, garantindo que cada consulta seja atendida pelo método de recuperação mais apropriado.
  • Estrutura de avaliação: conjunto de dados de referência anotados por humanos e testes A/B para medir melhorias na relevância.
  • Monitoramento e observabilidade: telemetria em tempo real para o desempenho do serviço do modelo (latência, erros, etc.) e ferramentas para monitorar a qualidade da previsão do modelo ao longo do tempo.
  • Controles éticos e de qualidade: auditoria de viés, filtragem de conteúdo e critérios de correção para quaisquer resultados gerados por IA.
  • Colaboração no design: garantir que o design determine quais dados são necessários em uma determinada experiência da pessoa usuária e que os sistemas de aprendizado de máquina forneçam esses dados com o nível de qualidade e desempenho técnico esperado.

Flexibilizando a correspondência de palavras-chave em nossa busca existente

Pesquisa realizada por Peter Fischer, engenheiro de software sênior da equipe Data Platform Engineering .

Hipótese: Se flexibilizarmos a correspondência de palavras-chave na Busca, poderemos oferecer um melhor suporte às consultas em linguagem natural e permitir que a equipe de Produto avalie essa capacidade, incluindo-a na forma como a equipe projeta, prioriza e entrega trabalho no espaço de Busca Semântica.

Status: Não comprovada.

Perguntas-chave:

  • Será que realmente precisamos investir em novos métodos de recuperação para proporcionar a experiência que temos em mente?
  • Nosso método de recuperação atual é flexível o suficiente para suportar diferentes tipos de consultas?

Metodologia: O trabalho de prototipagem foi realizado no âmbito de phab:T405869, no qual engenheiros testaram variações no nível de rigor da correspondência de consultas no CirrusSearch/OpenSearch.

A abordagem envolveu:

  • Relaxar as restrições de correspondência de palavras-chave para permitir uma recuperação mais flexível (por exemplo, correspondência parcial de termos, lematização, stemização).
  • Executar avaliações comparativas de relevância em um conjunto representativo de consultas em linguagem natural.
  • Medir os efeitos na revocação e na relevância percebida contra a busca de linha de base e amostras de recuperação baseadas em incorporação produzidas pela equipe de aprendizado de máquina.

Principais resultados:

  • Relaxar a correspondência de palavras-chave por si só não é suficiente.
    • Uma correspondência lexical menos rigorosa aumenta a revocação, mas não a relevância; a qualidade das correspondências permanece inferior àquela alcançável com incorporações.
  • Valor incremental no pré-processamento.
    • A extração de entidades, a expansão de aliases e a reformulação de consultas podem melhorar a revocação em consultas em linguagem natural a um custo relativamente baixo. Vale a pena investir nessas otimizações, mas elas não conseguem replicar totalmente a relevância semântica.
  • Limitações atuais do sistema.
    • CirrusSearch/OpenSearch pode suportar melhorias lexicais modestas e extensões de reclassificação, mas carece da arquitetura necessária para lidar nativamente com incorporações vetoriais ou recuperação baseada em significado em grande escala.

Implicações:

  • A curto prazo:
    • A engenharia de busca pode aprimorar a recuperação lexical existente para melhorar a qualidade básica e a experiência da pessoa usuária, independentemente da implementação semântica.
    • Um MVP teria que se basear na abordagem de recuperação híbrida recomendada pelas equipes de Aprendizado de Máquina e Design. As otimizações de busca existentes poderiam contribuir para esse pipeline, mas não substituí-lo.
  • A longo prazo:
    • À medida que a infraestrutura híbrida amadurece, a Busca pode integrar melhorias no pré-processamento para reduzir o custo computacional e expandir o suporte a vários idiomas.
    • As otimizações de busca devem complementar, e não substituir, os recursos semânticos ou lexicais. Nosso objetivo continua sendo garantir que a Wikipedia possa lidar com consultas tradicionais baseadas em palavras-chave e em significados dentro de uma experiência unificada.

Pesquisa de design do protótipo de dados

Pesquisa realizada por Mike Raish, pesquisador-chefe de design da Equipe de Pesquisa de Design .

Hipótese: Se avaliarmos dois protótipos de busca semântica (busca em linguagem natural e perguntas e respostas) com participantes externos, poderemos saber se as pessoas usuárias reconhecem o valor das ferramentas de busca aprimoradas e fornecer às equipes de Pessoas leitoras uma recomendação sobre como prosseguir com um MVP de busca e descoberta.

Status: Parcialmente comprovada.

Metodologia: Foi realizada uma pesquisa aleatória com 52 pessoas leitoras da Wikipédia que falam inglês (recrutadas através do Userlytics) utilizando o Qualtrics. Participantes avaliaram a relevância dos resultados de busca para 14 consultas reais na Wikipédia — 10 sem erros de digitação e 4 com erros de digitação — comparando os resultados da Busca Semântica com os resultados de busca por palavras-chave existente na Wikipédia.

Cada participante visualizou conjuntos de resultados aleatórios e informou:

  • Qual conjunto de resultados consideraram mais relevante (semântico, Wikipedia, ambos ou nenhum dos dois).
  • Sua familiaridade com cada tema, domínio da tecnologia e proficiência em leitura em inglês.

Participantes visualizaram páginas de resultados de busca reais, extraídas do protótipo de dados de Busca Semântica (outubro de 2025).

Principais resultados:

  • Preferência geral pela Busca Semântica.
    • Em 10 consultas sem erros de digitação, os/as participantes preferiram a Busca Semântica em 8 casos, a Busca da Wikipédia em 1 e classificaram ambas como irrelevantes em 1 caso.
  • Lidando com erros de digitação
    • Em 2 das 4 consultas com erros de digitação, os/as participantes preferiram a Busca Semântica; nas 2 restantes, nenhuma das duas opções foi considerada relevante.
  • Alto grau de concordância com o “teste visual” interno.
    • As preferências dos/das participantes coincidiram com as avaliações de internas de relevância da equipe da Fundação Wikimedia para 7 das 10 consultas sem erros de digitação e para todas as 4 consultas com erros de digitação.
  • Desempenho variável por tópico.
    • A Busca Semântica teve dificuldades com entidades nomeadas altamente específicas (por exemplo, "General Grievous"), onde a precisão das palavras-chave da Wikipédia apresentou melhor desempenho.
  • Insight comportamental
    • Participantes do teste piloto (que tiveram suas telas gravadas) clicaram nos artigos da Wikipédia antes de concluir as avaliações, o que sugere que as pessoas leitoras podem perceber a busca principalmente como uma ferramenta de navegação e exploração, e não como um ponto final.
  • Fatores demográficos
    • Não foram observadas diferenças significativas em termos de domínio tecnológico, nível de escolaridade ou familiaridade com a Wikipédia. Ligeira indicação de uma relação entre o alto nível de proficiência em inglês e a preferência pela Busca Semântica.

Recomendações Realizar um estudo em maior escala dentro de uma interface “Wikificada” para fundamentar recomendações para:

  • Extensão do texto do resultado (frase vs. parágrafo)
  • Tipo de consulta (factual x exploratória)
  • Ordem de apresentação e etiquetagem
  • Métricas de avaliação para resultados significativos para as pessoas leitoras
  • Relevância avaliada por humanos

Possíveis próximos passos

Experimento de busca híbrida

Objetivo: Transformar os insights validados da Fase 0 em um experimento de produção que funcione como um ambiente de pesquisa em escala.

Principais áreas

  • Implementação de recuperação híbrida – Implementar uma abordagem inicial simplificada para utilizar métodos de recuperação semântica e lexical com base na intenção da consulta.
  • Validação da experiência da pessoa usuária – Testar como o tamanho do trecho, o estilo do snippet e a etiquetagem de origem afetam a satisfação, a taxa de cliques e o "bom abandono".
  • SLOs do serviço de busca – Garantir que nossa infraestrutura MVP nos permita monitorar SLOs importantes, como latência, custo, taxa de erros, etc., em condições reais de tráfego.
  • Colaboração da comunidade – Estabelecer parcerias com wikis-alvo para implementar um experimento em escala em wikis com discussões abertas em páginas de discussão, discussões no Discord e boletins informativos periódicos.
  • Estrutura de Avaliação – Iniciar uma avaliação comparativa contínua offline/online com conjuntos de consultas avaliadas por humanos para orientar o ajuste do modelo.

Trabalho em paralelo

  • Aprimoramentos na busca lexical – Continuar aprimorando o pré-processamento de consultas (por exemplo, extração de entidades, lematização) e a lógica de classificação na stack atual. Essas melhorias serão eventualmente incorporadas à abordagem de busca híbrida, possivelmente após a entrega do MVP (Produto Viável Mínimo).
  • Infraestrutura de avaliação – Criar ferramentas compartilhadas para registro, anotação e telemetria, para que as buscas lexicais e semânticas possam ser medidas da mesma maneira.
  • Exploração de modelos de aprendizado de máquina – Testar modelos adicionais de incorporação e reclassificação para melhorar a eficiência e a precisão sem atrasar o lançamento do MVP.
  • Comunidade e Comunicações – Manter a divulgação, os ciclos de feedback e a documentação em paralelo com o desenvolvimento técnico para orientar o trabalho a curto prazo e analisar possibilidades ou mudanças de rumo a longo prazo.

Experimento de perguntas e respostas

Objetivo: Aproveitar a infraestrutura e os insights comportamentais para analisar experiências de descoberta descontraída/passiva que ajudem as pessoas leitoras a entender rapidamente o que uma página pode responder.

Áreas de foco em potencial:

  • Analisar modelos de colaboração entre pessoas editoras para a geração ou aprovação de perguntas.
  • Continuar a iteração da experiência da pessoa usuária em relação às affordances dos links diretos, à clareza das informações e ao número de perguntas apresentadas.
  • Introduzir os módulos de perguntas e respostas somente quando a geração de perguntas atingir precisão suficiente e validação humana.

Dependências:

  • Conjunto de dados de avaliação confiável e pipeline de métricas
  • Latência comprovada da recuperação híbrida.
  • Normas e mecanismos de feedback da comunidade estabelecidos.

Fluxos de trabalho em paralelo:

  • Análises detalhadas do produto usando telemetria MVP para melhorar a geração de perguntas e a correspondência semântica.
  • Ciclos de pesquisa de design que exploram a navegação baseada na curiosidade e a compreensão da pessoa usuária das funcionalidades da busca descontraída/passiva.

Perguntas para as comunidades

Gostaríamos de colaborar com as comunidades a fim de obter informações sobre:

  • Quais são suas reações gerais em relação ao relatório? Há algo em particular que chama sua atenção?
  • Gostaria que entrássemos em contato com a comunidade do seu idioma para discutir a possibilidade de realizar experimentos piloto em pequena escala no futuro próximo?
  • Que sinais/dados seriam úteis para determinar se valeria a pena disponibilizar para a wiki de seu idioma uma versão mais refinada de módulos de busca híbrida e/ou de perguntas e respostas após a fase experimental?