Jump to content

Ajuda:Extensão:Wikisource/Wikimedia OCR

From mediawiki.org
This page is a translated version of the page Help:Extension:Wikisource/Wikimedia OCR and the translation is 80% complete.
Outdated translations are marked like this.

O recurso Wikimedia OCR da extensão Wikisource adiciona uma interface de barra de ferramentas à barra de ferramentas de edição principal ao editar no espaço de nome Página, para extrair rapidamente o texto da imagem da página e adicioná-lo à caixa de texto do corpo da página. OCR significa Optical Character Recognition (reconhecimento óptico de caracteres) e é o processo pelo qual o texto em uma imagem fotográfica pode ser transformado em texto editável e, assim, adicionado a um wiki.

O botão e o menu suspenso.

Para usar esse recurso, clique no botão Screenshot of a button with text 'Transcrever o texto'. no lado direito da barra de ferramentas de edição principal. Isso executará o processo de OCR e colocará o texto resultante no campo do corpo da página no formulário de edição (substituindo qualquer texto que já esteja lá). Um botão "desfazer" é exibido na parte superior do campo do corpo, permitindo que você retorne ao estado anterior do campo, se desejar.

Em sua forma básica, essa é toda a funcionalidade do Wikimedia OCR, mas há alguns recursos avançados que podem ser úteis em algumas circunstâncias, disponíveis no menu suspenso à direita do botão principal "Extrair texto". Esses recursos avançados permitem escolher um mecanismo de OCR diferente; definir uma lista de idiomas para ajudar o software a detectar palavras; ou selecionar uma área menor da página da qual extrair o texto. Todas elas são explicadas abaixo e observe que, com exceção da escolha do motor, todas estão disponíveis no item de menu "Advanced options" (Opções avançadas), que abre uma nova guia.

The Advanced options form.

Motores

Atualmente, há três mecanismos de OCR disponíveis: Tesseract, Google e Transkribus. O Tesseract é uma ferramenta de código aberto que é executada internamente e oferece suporte a uma ampla variedade de idiomas e outras opções. O Google OCR é um serviço proprietário, também compatível com vários idiomas, mas com menos opções. O Transkribus é apoiado por uma cooperativa da UE READ-COOP e fez uma parceria com a Wikimedia Foundation para fornecer um número limitado de créditos gratuitos para apoiar o projeto Wikisource Loves Manuscripts.

A escolha de qual usar pode variar de acordo com a natureza da imagem a ser processada.

Para trocar de motor, selecione o botão de rádio relevante no menu suspenso. Sua escolha será lembrada para o dispositivo atual e poderá ser alterada a qualquer momento.

Idiomas

Clicking the Opções avançadas menu item opens a new tab with a transcription form containing a field for selecting the language or languages that are used in the page of text being extracted.

Isso é útil porque os mecanismos de OCR podem ser muito mais precisos quando sabem quais idiomas esperar.

Nem todos os idiomas são compatíveis com todos os mecanismos e, se você mudar o mecanismo, a lista de idiomas disponíveis também será alterada.

Se o seu idioma não estiver na lista, você pode deixar o campo Idiomas vazio e o mecanismo de OCR tentará extrair o texto que puder. Isso pode ter resultados variados, mas vale a pena tentar.

Área de cultivo

The crop button.

Para extrair texto de apenas uma parte de uma imagem (por exemplo, uma única coluna de uma página de um jornal), é possível selecionar uma área de corte. Do this by first clicking the crop button (, see screenshot at right), and then clicking and dragging over the page image to draw a rectangle. A imagem pode ser ampliada e panoramizada, e o retângulo de corte pode ser movido e redimensionado conforme necessário. Há botões acima da imagem para alternar entre mover e recortar. Depois de selecionar a área desejada, clique em "Extract area" (Extrair área) e o texto somente para essa área será exibido na caixa de texto do lado direito.

Retornando das Opções avançadas

Depois de usar o formulário de opções avançadas para extrair o texto, é necessário copiar e colar o texto resultante de volta no campo de corpo do formulário de edição de página. To make this a bit quicker, a Copy to clipboard button is provided.

Primeiro uso

The first time you open a page for editing, a pulsating blue dot is shown on the Extract text button. Clicar nesse ponto ou em um dos botões abrirá uma janela pop-up explicando o que é esse recurso. Depois que esse pop-up for descartado, ele não será exibido novamente (no mesmo dispositivo).

Problemas

If you encounter any issues with using Wikimedia OCR, please report them on Phabricator, under the Wikisource OCR tag.