Jump to content

Pessoas leitoras/Recuperação de Informações/Fase 1

From mediawiki.org
This page is a translated version of the page Readers/Information Retrieval/Phase 1 and the translation is 100% complete.

A Fase 1 baseia-se diretamente nos resultados e discussões da Fase 0: Validação da ideia. Na Fase 0, aprendemos que algumas pessoas leitoras têm dificuldade em encontrar informações específicas na Wikipédia usando a busca interna — especialmente quando suas consultas são formuladas como perguntas ou em linguagem natural, e que uma abordagem híbrida de busca pode valer a pena ser explorada mais a fundo.

O objetivo da Fase 1 é passar da análise conceitual para um pequeno experimento de produção e com prazo determinado, em um número reduzido de wikis piloto, para que possamos aprender com o comportamento real das pessoas leitoras em escala. Esta fase não se trata do lançamento de uma funcionalidade permanente. Em vez disso, a Fase 1 foi concebida para nos ajudar a compreender se a busca híbrida melhora significativamente a localização de informações na Wikipédia e em que condições.

O experimento será apresentado a um conjunto de pessoas leitoras em wikis piloto, principalmente pessoas leitoras não autenticadas, para que possamos comparar o comportamento entre a busca existente e variantes híbridas. Nesta fase, as pessoas editoras não serão incluídas no grupo experimental.

O vídeo mostra um design em fase inicial para um experimento de busca híbrida.

O que entendemos por “busca híbrida”

Neste projeto, a busca híbrida refere-se à utilização de duas abordagens para recuperar informações:

  • A busca por palavras-chave (léxical), que funciona bem quando as pessoas leitoras sabem o título ou nome exato do artigo que estão procurando.
  • Recuperação baseada em significado (semântica), que pode dar melhor suporte a consultas em formato de perguntas ou exploratórias, mesmo que as palavras não correspondam perfeitamente ao título ou às palavras exatas de um artigo.

Todos os resultados apresentados nesta fase serão extraídos de artigos e seções existentes da Wikipédia, criados por seres humanos. Este trabalho não envolve a geração de novas respostas, a reescrita de conteúdo ou o resumo de artigos. O objetivo é melhorar a forma como as pessoas leitoras são direcionadas para as partes relevantes já existentes da enciclopédia, adicionando recuperação semântica aos resultados da busca.

Ao final da Fase 1, esperamos estar em melhor condições para decidir se este trabalho deve continuar, mudar de direção ou ser interrompido.

O que a Fase 1 não incluirá

Com base nos resultados da Fase 0 e no feedback da comunidade, várias ideias foram intencionalmente excluídas do escopo desta fase.

A Fase 1 da busca semântica não introduzirá interfaces no estilo de chat, nem resumos de conteúdo. Também não incluirá personalização, consultas preditivas ou recuperação de dados em vários idiomas provenientes de outros projetos da Wikimedia, como o Commons ou o Wikidata. Por fim, a Fase 1 também não introduzirá novos pontos de busca nem substituirá o comportamento de busca existente; ela se baseia na experiência de busca atual, com alterações limitadas e testáveis.

Essas restrições nos ajudam a evitar a introdução de questões técnicas, editoriais e de governança adicionais que não são apropriadas para serem abordadas antes que questões fundamentais de recuperação e confiança sejam respondidas.

Como vamos aprender e avaliar os resultados

A Fase 1 avaliará diferentes abordagens de recuperação e apresentação de informações por meio de um teste A/B.

Neste experimento, o grupo de controle verá a experiência de busca atual na Wikipédia, enquanto o grupo experimental verá a mesma experiência com a adição de resultados semânticos. Isso nos permite comparar como as pessoas leitoras interagem com a busca existente em comparação com a recuperação semântica, além da lexical, em condições reais.

Mais especificamente, nos interessa saber:

  • Se mostrar trechos curtos de artigos (por exemplo, frases ou parágrafos curtos vinculados a uma seção) ajuda as pessoas leitoras a decidir mais rapidamente se um resultado é relevante.
  • Como a indicação clara da fonte de um trecho – tais como o artigo e a seção de onde ele foi extraído – afeta a compreensão e a confiança.

Essas questões surgiram repetidamente na pesquisa e nas discussões com a comunidade da Fase 0, especialmente em relação às preocupações com a perda de contexto, atribuição e confusão por parte de quem está lendo.

Além disso, vamos analisar uma combinação de sinais comportamentais, feedback qualitativo e indicadores de confiança. Também monitoraremos de perto as salvaguardas relacionadas ao desempenho e à retenção geral. Se os resultados sugerirem um impacto negativo na confiança, clareza ou usabilidade, o experimento será ajustado ou encerrado.

No entanto, caso os indicadores sugerirem que essa abordagem deve ser mantida, podemos aprender com os dados coletados no experimento e usá-los como base para decidir quando a busca deve se basear em palavras-chave, quando incorporar a recuperação semântica e como as duas podem se complementar, dependendo da consulta.

Este experimento é intencionalmente bastante restrito. Os testes serão executados em iterações curtas e com prazos definidos, em vez de uma implementação de longa duração, o que nos permitirá comparar variantes, incorporar feedback e ajustar ou interromper o processo conforme necessário.

Status e cronograma da Fase 1

Os trabalhos da Fase 1 estão começando, com a equipe focada na exploração do design, na viabilidade técnica e na incorporação do feedback inicial da comunidade sobre a estrutura do experimento da Fase 1. Qualquer teste de produção com pessoas leitoras ocorrerá somente após a conclusão deste trabalho preparatório, e os detalhes serão compartilhados aqui e por meio de atualizações com antecedência e ao longo de todo o experimento.

Como se trata de um experimento intencionalmente pequeno e iterativo, nosso objetivo é testá-lo em produção e obter insights iniciais para discussão por volta de março de 2026. Este cronograma é flexível e pode sofrer alterações à medida que obtivermos mais informações sobre o esforço técnico necessário e incorporarmos o feedback da comunidade.

As pessoas leitoras não serão solicitadas a escolher entre diferentes modos de busca. Em vez disso, o experimento pode apresentar resultados tanto da abordagem baseada em palavras-chave quanto da abordagem de recuperação semântica na mesma experiência de busca, para que possamos entender melhor o desempenho de cada uma delas em diferentes tipos de consultas.

Indicadores de sucesso

  • Aumentar o engajamento das pessoas leitoras com a busca na wiki: alcançar um aumento no número de sessões de busca iniciadas por pessoa usuária única em comparação com a linha de base.
  • Aumentar a profundidade do engajamento: alcançar um aumento na duração média da sessão (desde a primeira consulta até a última interação).
    • Indicador de apoio: acompanhar as consultas por sessão de busca, segmentadas em:
      • As consultas exploratórias ocorrem após um clique bem-sucedido + um tempo de permanência normal (curiosidade saudável/exploração aprofundada do conteúdo).
      • As consultas reformuladas são consultas quase idênticas ou consultas repetidas rapidamente após nenhum clique ou permanência curta (atrito).
  • Aumentar a eficiência na descoberta de conteúdo: reduzir o tempo médio até o clique em comparação com as linhas de base lexicais.
    • Indicadores de apoio: menor taxa de reformulação de consultas e maior número de cliques nos resultados mais bem classificados.
    • Acompanhar os abandonos positivos separadamente como buscas sem reformulação ou saída dentro do período de observação (indicando que a pessoa usuária provavelmente encontrou o que precisava no snippet ou na pré-visualização).
  • Aumentar a relevância e a satisfação percebidas: pelo menos 80% das pessoas usuárias concordam que os resultados da busca são relevantes e satisfatórios.
  • Aumentar a retenção de pessoas usuárias não autenticadas: aumentar a taxa de retorno de busca de sete dias para pessoas leitoras não autenticadas em 5% em relação á linha de base.
  • Gerar dados de aprendizagem validados.
  • Compreender as implicações de desempenho na produção: verificar se a latência mediana da busca aumenta em mais de 15% em comparação com a linha de base.
  • Manter a confiança: pelo menos 85% das pessoas usuárias pesquisadas/entrevistadas identificam corretamente a fonte de um snippet; o feedback negativo "não confiável ou confuso" permanece ≤ 5%.
  • Manter a retenção geral do aplicativo: não observamos uma diminuição estatisticamente significativa na retenção geral do aplicativo ao comparar os grupos de teste e controle.

Embora vamos monitorar todos os indicadores de sucesso mencionados acima, nossa principal métrica de sucesso é o aumento no engajamento total de buscas, definido como sessões iniciadas x duração média da sessão.

O que esta fase nos ajuda a decidir

Ao final da Fase 1, pretendemos ter respostas mais claras para perguntas como:

  • A busca híbrida ajuda as pessoas leitoras a encontrar informações na Wikipédia de forma mais eficaz?
  • Quais abordagens de recuperação e apresentação de informações funcionam melhor — e quais não funcionam?
  • As concessões técnicas e editoriais são aceitáveis no âmbito dos valores da Wikimedia?
  • Esse é um direcionamento que vale a pena continuar explorando?

A Fase 1 é um passo em direção à tomada de decisões informadas, e não um compromisso em relação a um resultado específico. Com isso em mente, se houver outras áreas que vocês gostariam que avaliássemos, por favor, nos informem na página de discussão.

Conceitos iniciais de design

Como parte da Fase 0, analisamos um conjunto de conceitos iniciais de design para nos ajudar a entender como as pessoas leitoras poderiam ter uma melhor descoberta de informações na Wikipédia. Esses conceitos eram intencionalmente protótipos que não entraram em produção, usados ​​em pesquisas e conversas com a comunidade para identificar reações, perguntas e preocupações, em vez de propor funcionalidades finalizadas.

Mais especificamente, o trabalho de design da Fase 0 concentrou-se em como as pessoas leitoras reagem quando os resultados da busca apresentam trechos curtos derivados de artigos (como snippets de seções) em vez de apenas links para os artigos completos. Pesquisas e feedback sugeriram que muitas pessoas leitoras valorizam a possibilidade de avaliar rapidamente a relevância do conteúdo e, quando apropriado, acessar diretamente uma parte específica de um artigo. Ao mesmo tempo, este trabalho também levantou questões importantes sobre contexto, atribuição e o risco de confundir conteúdo criado por humanos com resultados gerado por máquinas.

Esses conceitos iniciais nos ajudaram a esclarecer o que vale a pena explorar mais a fundo e o que requer cuidados adicionais ou deve ser adiado.

Wireframes da Fase 1

Os wireframes compartilhados na Fase 1 se baseiam diretamente nas aprendizagens da Fase 0. Em vez de introduzir novos modelos de interação, eles se concentram em um conjunto mais restrito de questões que surgiram de pesquisas anteriores e discussões da comunidade:

  • Qual é a melhor maneira de fazer com que as pessoas usuárias tomem uma decisão informada sobre testar o experimento?
  • Como podemos contornar visualmente a limitação técnica das pessoas usuárias decidirem qual método de recuperação escolher, em vez do sistema?
  • Quanta informação contextual é útil ao mostrar trechos nos resultados da busca?
  • Como a origem das informações deve ser apresentada para que as pessoas leitoras compreendam claramente de onde vem a informação?
  • Como diferentes layouts visuais afetam a leitura, a confiança e a tomada de decisões?
  • Como podemos obter feedback das pessoas usuárias sobre os resultados da busca, especialmente se elas estiverem obtendo as informações que precisam sem ter que clicar em um artigo completo?

Os wireframes são, portanto, artefatos exploratórios, destinados a apoiar discussões e testes, e não uma experiência final. Eles ilustram diferentes maneiras pelas quais o conteúdo existente da Wikipédia, criado por humanos, pode ser apresentado durante uma busca, para que possamos avaliar quais abordagens ajudam as pessoas leitoras sem gerar confusão ou interpretações errôneas.

Phase 1 MVP designs

Assim como na Fase 0, qualquer discussão sobre esses conceitos será avaliada juntamente com a viabilidade técnica, antes de determinar um caminho a seguir.

Agradecemos quaisquer comentários sobre o que parece claro, confuso, útil ou preocupante em relação a esses wireframes.

Envolvimento da comunidade

O feedback da comunidade já moldou o escopo e os limites da Fase 1, principalmente em relação às preocupações com a mistura de conteúdo gerado por IA e conteúdo criado por humanos, atribuição e o papel da busca em comparação com a recomendação. Ficamos felizes em continuar a conversa com as comunidades da Wikimedia na página de discussão.

Conversamos com a comunidade Discord da Wikipédia em inglês em 3 de dezembro de 2025 e na WikiCon North America em 19 de outubro de 2025. Comunidades piloto nas wikis em inglês, francês e português também têm se engajado na wiki. Também compartilhamos a busca semântica com a comunidade de pessoas administradoras africanas para obter feedback de pessoas editoras de wikis em idiomas menos difundidos.

Segue abaixo algumas citações em destaque:

  • "Ontem eu estava pesquisando alguns tópicos relacionados à Nova Zelândia. Digitei NZ {frase}, mas não apareceu o artigo correto; embora funcione com frequência suficiente para que eu faça isso instintivamente, coisas como essa ainda falham para mim boa parte das vezes. Ter um sistema de busca que lide com esse tipo de coisa seria uma maneira melhor de lidar com isso do que criar redirecionamentos para todos os tópicos imagináveis".
  • "Trabalhar em um sistema de busca melhor é uma boa ideia; a busca baseada em perguntas tem sido meu recurso principal no Google há 20 anos e agora eu uso LLMs."
  • "A busca em formato de chat será uma parte necessária da Wikipédia, à medida que essa se torna cada vez mais a forma como as pessoas esperam interagir com a internet. Crianças pequenas fazem perguntas à Alexa ou à Siri sem nunca navegar na internet. A Wikipédia antiga usava um modelo que quase não fazia uso de buscas; isso parece ser apenas um passo lógico".

Outras ideias e recomendações da comunidade incluíram:

  • Pessoas editoras podem adicionar âncoras no artigo para seções relevantes, a fim de facilitar a busca por seções específicas.
  • Pessoas editoras podem fornecer metadados ou anotações que melhoram a relevância da busca semântica.
  • A busca direciona as pessoas leitoras para títulos específicos dentro do artigo.
  • Utilização de tecnologias como a funçionalidade link para trecho de texto (scroll-to text fragment) para destacar o texto relevante do artigo.
  • Testar maneiras de exibir citações na busca.
  • Snippets melhorados nas páginas de resultados de busca.
  • Permitir a combinação de busca semântica e por palavras-chave na mesma consulta.

As pessoas editoras enfatizaram a necessidade de informar as pessoas leitoras caso algum texto ou conteúdo tenha sido gerado por IA, para futuras análises. Outro risco observado foi evitar a criação de incentivos para que as pessoas editoras “otimizassem” os artigos para melhorar a visibilidade nos mecanismos de busca, a fim de impedir a concorrência do tipo SEO, conteúdo promocional ou manipulação de resultados.

Outra preocupação era: "O que acontece quando as pessoas usuárias fazem perguntas que a Wikipédia não consegue responder?" É preciso encontrar uma maneira "apropriada para a Wikipédia" de informar as pessoas leitoras com delicadeza e orientá-las a compreender que a Wikipédia não é a fonte certa.

Para as pessoas leitoras expostas ao experimento, a experiência da Fase 1 será claramente identificada como um experimento. As pessoas leitoras terão a oportunidade de optar por não participar do experimento. Quem optar por não participar continuará vendo a experiência de busca atual, sem alterações. As pessoas leitoras que optarem por participar continuarão a ver os resultados existentes baseados em palavras-chave (lexicais), com resultados semânticos adicionais exibidos juntamente com eles como parte do experimento. Isso nos permitirá aprender sem interromper a recuperação de informações por parte das pessoas leitoras.

Ao longo da Fase 1, continuaremos a compartilhar atualizações, resultados e perguntas em aberto na página do projeto e estaremos abertos a discussões. Qualquer proposta para expandir, dar continuidade ou tornar permanentes aspectos deste trabalho será submetida primeiro à comunidade para uma discussão mais aprofundada. Se você gostaria que a equipe que trabalha neste projeto participasse de algum espaço da comunidade, não hesite em nos informar na página de discussão.

Wikis piloto

Por enquanto, trabalharemos com as Wikipédias em grego, francês, inglês e português para a Fase 1. Embora o experimento piloto esteja disponível para um conjunto de pessoas leitoras nas wikis nesses idiomas, Estamos abertos a discussões com membros da comunidade além desses idiomas. Gostaríamos de compartilhar aqui uma atualização do cronograma: daremos início ao experimento no aplicativo Android da Wikipédia em grego no final de fevereiro, seguido pelas versões em inglês, francês e português, provavelmente em março.

Atualização: A partir de 12 de março, a equipe de aplicativos lançou este experimento na Wikipédia em francês na versão Beta do aplicativo Android e, em 21 de março, nas Wikipédias em inglês e português.

Report: Phase 1 - Hybrid Search Experiment Results

Synthesis of Findings

Phase 1 of the hybrid search experiment has been completed. This phase moved this work from conceptual exploration to a time-bound production experiment on a small number of pilot wikis, testing whether hybrid search (semantic+lexical retrieval) improves how readers discover and navigate information especially for intent-driven and natural-language queries.

The experiment ran for 14 days on the Android app across multiple pilot wikis and generated 3.6 million search sessions from over 300,000 users. We observed a consistent engagement increase of 6.9% to 7.9%, with overall app retention remaining stable.

At the same time, important gaps were identified. A majority of users perceived the experience as AI-generated despite multiple signals to the contrary; trust and provenance indicators were often missed, and efficiency declined in some cases, with time-to-click increasing (up to +45% in one variant).

Satisfaction signals were also inconclusive, with fewer than 0.4% of users engaging with the rating prompt. Overall, the core concept is validated, but the current implementation introduces friction and requires redesign before any broader rollout.

Based on these findings, the project will move into Phase 2 with a revised approach. The primary change will be introducing query routing, where the majority of queries (estimated ~75–82% short keyword queries) will continue to use lexical search, and only longer or natural language queries will be routed to semantic results. This is expected to reduce friction, improve efficiency, and lower infrastructure cost by limiting semantic processing to the queries where it performs best.

Phase 2 will also focus on improving how results are presented, especially making paragraph-level retrieval more visible and useful, and redesigning trust and provenance signals so users better understand that content is human-authored. Additional work will include:

  • Strengthening measurement (e.g., tracking reformulation and successful no-click sessions).
  • Improving opt-out visibility.
  • Addressing known issues like section deep-linking precision and improving system monitoring.

Phase 2 will be treated as a production-ready build, starting with smaller rollouts and expanding based on the strength of the signal. We will continue to collaborate with the community as we go, seeking ideas and feedback on the best possible way to build this together.

Please share your feedback and questions at this project page. We want to hear from you!

Scope of Phase 1 Experiment (Hybrid Search MVP)

Platform Wikipedia Android App
Audience Logged-out readers (logged-in included for signal); EN, FR, PT, EL
Duration 14 day ABC test
Control Existing lexical search experience
Experiment Semantic and lexical results with section level snippets and different positioning of results
Out of Scope Generative Q&A, personalization, query prediction, summarization

Key Constraints

  • All queries received semantic results regardless of type, generating the interaction volume needed for evaluation but producing less-than-ideal clickthrough rates and efficiency metrics.
  • Predictive text [aka Type Ahead] was retained, introducing an extra tap before semantic results were shown.
  • Semantic and lexical results were shown in parallel, with semantic results marked as “beta.”
  • The experiment ran for 14 days, too short to observe habit formation or steady-state behavior change.
  • Phase 1 ran exclusively on the Wikipedia Android app due to its users having higher on Wikipedia search behavior than other platforms.

Overall Results

Phase 1 produced enough positive signal to justify continued investment, and enough honest failure to make clear that Phase 2 needs to be built differently. Across five disciplines, the experiment validated the core premise that hybrid search can increase reader engagement without harming retention or breaking the app. It also revealed, with useful specificity, where the current implementation falls short and what would need to change before any meaningful scale-up.

What Worked What Didn't
6.9% to 7.9% engagement lift across treatment arms, consistent across all four pilot wikis Engagement lift fell short of the 10% hypothesis target on the average-based calculation
3.6M searches from 300K users generated a validated real-world dataset that enabled query-type analysis, routing threshold recommendations, and satisfaction scoring that annotated benchmarks alone could not have produced Trust was fragmented for those that didn’t understand the feature was not genAI
Initial openness to the feature concept was genuine across all participant groups Provenance labeling was missed or misinterpreted across all three research stages
Overall app retention and 7-day search feature retention flat to positive Most users perceived semantic results as AI-generated despite multiple UI signals
Tail latency (p95) held flat at 240ms Median latency increased 117% at the infrastructure level exceeding the guardrail
Production architecture proved stable enough under real traffic to complete the experiment Two production failures occurred during the experiment and were detected reactively rather than proactively: an inference routing outage affecting users in the codfw datacenter, and a partial index that silently served approximately 10% of the expected corpus for three days. Both were resolved, but neither was caught by automated monitoring
Embedding infrastructure scaled without issue and has headroom Satisfaction measurement was inconclusive, with fewer than .4% users engaging with the rating prompt
Offline evaluation confirmed retrieval quality exceeded the benchmark Efficiency metrics pointed toward an experience that added friction for users who needed it least

Taken together, the findings support launching Phase 2 as a redesigned scaled release, one with query routing at its foundation, a fundamentally different approach to provenance and trust signaling, a stronger measurement framework, and a stronger strategic positioning around exploration and discovery rather than direct question answering.

Readiness for Next Phase

What’s Ready Now:

  • Core production architecture is validated and stable across four pilot wikis
  • Embedding infrastructure scaled without issue and has meaningful headroom before any capacity investment is required
  • CirrusSearch Action API integration proved reliable and should be the standard path for all future wiki onboarding
  • Overall app retention and second-week search feature retention were unaffected, confirming hybrid search can be introduced without harming the broader app experience
  • Offline evaluation shows jina-embeddings-v5-text-nano is a clear model upgrade over Qwen3, outperforming across every query type at both article and paragraph levels while requiring significantly less compute
  • Initial routing logic is ready to implement, directing short and medium queries to lexical search and long queries and natural language questions to semantic search

What We Need to Address in Phase 2:

  • Routing thresholds should be refined against live traffic as Phase 2 progresses rather than validated in advance
  • Multi-datacenter inference deployment gap is a known, bounded problem with a clear fix and should be resolved early in Phase 2 planning
  • Automated data quality monitoring on the embedding index is a straightforward addition to prioritize in Phase 2 setup
  • Section deep-linking precision, GrowthBook integration, and instrumentation refinements are improvements to make during Phase 2
  • Onboarding language, result card design, provenance labeling, and opt-out visibility should be updated before new users are exposed to the Phase 2 experience; these are design and copy changes, not infrastructure blockers
  • The GenAI perception problem should be treated as the first Phase 2 design sprint
  • Good abandonment tracking, reformulation rate measurement, and a redesigned satisfaction signal should be defined as part of Phase 2 launch preparation
  • Evaluation of possible biases and how to address it moving forward in partnership with legal
  • An updated cost estimate if pilot wikis maintained Phase 2 approach

Out of Scope for Phase 2 But Potential Future Work

  • Native server-side hybrid retrieval within CirrusSearch is the right long-term architecture target but requires formal evaluation before any commitment
  • Detailed infrastructure cost model covering GPU inference, operational costs, and engineering time should be developed before scaling beyond Phase 2 pilot wikis. Order of magnitude estimate based on Phase 1 infrastructure should account for 95% of queries remaining on lexical path.
  • Comparative evaluation of chunking strategies beyond the current paragraph-level approach is a high-leverage future investment
  • Expansion beyond the 15 languages supported by jina-embeddings requires alternative approaches to offline model evaluation and is a post-Phase 2 decision
  • Repeatable multilingual benchmark covering realistic query distributions is a longer-term infrastructure investment Phase 2 should begin building toward

Strategic Takeaway

Phase 1 earned a go decision. The engagement signal is consistent across four pilot wikis, and the failure modes are well understood and addressable. The recommendation is to move to Phase 2: build this for real and release it, seeking and incorporating community feedback as we go.

The central strategic insight from Phase 1 is not about search technology. It is about positioning. Wikipedia has something no AI tool can replicate: a human-authored, editorially accountable encyclopedia built by thousands of contributors and backed by verifiable sources. Phase 1 showed that the current implementation inadvertently obscures that advantage rather than expressing it. Most users perceived the experience as an AI-generated feature. That is not a UX problem; it is a strategic misalignment between what Wikipedia is and what the product is communicating. Phase 2's most crucial work is closing that gap and making it clear that our surfaced results are all human-authored.