Extrair preços ou fichas de produto de um site público continua, em regra, a ser permitido em França. O scraping de dados muda de natureza quando visa pessoas identificáveis: o RGPD (Regulamento UE 2016/679, aplicável desde 25 de maio de 2018) aplica-se então mesmo a um perfil visível para todos. Na sua ficha de 19 de junho de 2025, a CNIL (Commission nationale de l’informatique et des libertés, a autoridade francesa de proteção de dados) indica que esta recolha automatizada assenta geralmente no interesse legítimo (artigo 6.º, n.º 1, alínea f), com salvaguardas precisas. Atrás de uma página protegida por palavra-passe, é o Código Penal francês que passa a aplicar-se.

Scraping de dados: definição e funcionamento

Um programa pede uma página a um servidor web, como faria o Chrome ou o Firefox. Lê o código HTML devolvido e isola os campos que lhe interessam: um preço, um nome, uma morada, uma avaliação. O resultado acaba numa folha de cálculo ou numa base de dados. As bibliotecas Python Beautiful Soup e Scrapy fazem este trabalho há anos; para as páginas construídas em JavaScript, a ferramenta controla um navegador sem janela, como o Playwright ou o Puppeteer. Proxies mudam o endereço IP para contornar os limites de pedidos.

A utilização vai da monitorização de preços à constituição de ficheiros de prospeção, passando pelo treino de modelos de IA. Estes ficheiros alimentam muitas vezes sequências de emails automatizados: um contacto adicionado sem verificação é aí contactado várias vezes antes de o erro se tornar visível.

Duas pessoas a trabalhar em computadores, com servidores ao fundo: extração automatizada de dados web e conformidade com o RGPD

Scraping, crawling e API: três formas de ler um site

O crawling percorre as ligações de um site para desenhar o seu mapa; é o ofício do Googlebot. O scraping recolhe campos precisos em cada página visitada. Um crawler pode alimentar um scraper, e a maioria das ferramentas junta aliás as duas funções. Só o scraper produz um conjunto de dados reutilizável.

A API funciona de outra maneira. O próprio site publica um ponto de acesso, com as suas quotas e condições de reutilização: o acordo dele está garantido à partida, o que o scraping nem sempre pode invocar.

O scraping é legal em França? A resposta depende do dado

Sim, sob condições: tudo depende da natureza do dado e da forma de o recolher. Três perguntas permitem situar um projeto. O dado diz respeito a uma pessoa identificável? Está acessível sem início de sessão? O site manifestou a sua recusa através dos termos de utilização ou de um ficheiro robots.txt? Cada resposta abre um regime diferente.

Dados não pessoais: bases de dados e concorrência

Um catálogo de preços não está abrangido pelo RGPD. Mas continua protegido por outro texto, decorrente da Diretiva 96/9/CE de 11 de março de 1996. O produtor de uma base de dados pode proibir a extração de uma parte substancial do seu conteúdo (artigo L342-1 do Código da Propriedade Intelectual francês, Code de la propriété intellectuelle, que visa também as extrações repetidas de partes não substanciais, artigo L342-2). O Tribunal de Recurso de Paris (cour d’appel de Paris) aplicou-o em 2 de fevereiro de 2021 (n.º 17/17688). O LeBonCoin obteve a condenação do Entreparticuliers.com, que reproduzia os seus anúncios imobiliários, incluindo 20 000 € pelo dano de imagem.

No plano do direito de autor, a exceção de prospeção de textos e dados (text and data mining) prevista na Diretiva (UE) 2019/790 autoriza certas extrações. Deixa de se aplicar quando o titular reservou os seus direitos de forma adequada, por exemplo por um meio de leitura automática, no caso de conteúdos em linha.

Dados pessoais: a ficha da CNIL de junho de 2025

Um dado público continua a ser um dado pessoal. O nome e a função de um trabalhador estão abrangidos pelo RGPD mesmo quando constam de uma página aberta. A «ficha focus sobre as medidas a tomar em caso de recolha de dados por moissonnage (web scraping)», publicada pela CNIL em 19 de junho de 2025, indica que esta recolha assenta geralmente no interesse legítimo, desde que se acrescentem medidas que protejam as pessoas. A recolha automatizada não é proibida em si; a análise faz-se caso a caso.

Os exemplos da ficha incidem sobretudo na constituição de bases de treino para IA. As suas salvaguardas servem de referência para uma recolha mais ampla, sem terem sido escritas a pensar na prospeção.

  • Minimização: definir previamente critérios precisos de recolha e eliminar o que não é necessário assim que for identificado.
  • Exclusão dos sites que se opõem à recolha, sinalizada por robots.txt ou por um CAPTCHA.
  • Direito de oposição «discricionário e prévio» para as pessoas em causa.
  • Informação difundida o mais amplamente possível sobre a recolha e os direitos existentes, por exemplo publicando a lista dos sites visados.
  • Eliminação automatizada dos dados sensíveis descobertos a posteriori; atenção particular aos menores.

A ficha pede para «excluir da recolha os sites que se opõem claramente à recolha automatizada do seu conteúdo» (tradução nossa): sem esta precaução, segundo a CNIL, o tratamento sai das expectativas razoáveis das pessoas.

Estas exigências prolongam-se na obrigação de informar as pessoas cujos dados foram obtidos noutro lugar (artigo 14.º do RGPD) e na escolha de uma finalidade precisa antes do primeiro pedido. Consoante a dimensão do ficheiro e a natureza dos dados, pode somar-se uma avaliação de impacto (AIPD).

Páginas atrás de um início de sessão e termos de utilização

Uma conta criada para chegar a perfis fechados muda tudo. Aceder ou manter-se fraudulentamente num sistema de tratamento automatizado de dados constitui crime (artigo 323-1 do Código Penal francês, Code pénal), punido com 3 anos de prisão e 100 000 € de coima.

Os termos de utilização criam, por seu lado, uma obrigação contratual. O Tribunal de Justiça da União Europeia decidiu em 15 de janeiro de 2015 (processo Ryanair, C-30/14) que um site pode limitar por contrato a reutilização de uma base que nem o direito de autor nem o direito sui generis protegem. A CNIL lembra-o: os termos de utilização podem proibir a recolha automatizada.

O que passa e o que não passa

O scraping de dados consoante a natureza do dado e do site
Situação Veredicto Base jurídica
Preços e características de produtos numa página pública Geralmente permitido Fora do RGPD; limite além de uma extração substancial (direito das bases de dados)
Perfis públicos de pessoas, com minimização e oposição prévia Possível sob condições Interesse legítimo, ficha da CNIL de 19 de junho de 2025
Site que proíbe a recolha (robots.txt, CAPTCHA, termos de utilização) A excluir Condição do interesse legítimo; risco contratual
Conteúdo atrás de um início de sessão, acesso obtido por desvio Ilegal Acesso fraudulento, Código Penal francês, art. 323-1
Fotografias de rostos sem base legal Ilegal RGPD; sanção da CNIL de 17 de outubro de 2022 contra a Clearview AI
Anúncios ou base de um concorrente reutilizados em massa Arriscado Direito sui generis (artigos L342-1 e L342-2 do Código da Propriedade Intelectual francês)

hiQ, Meta, Clearview: o que as decisões esclareceram

O processo hiQ contra o LinkedIn lê-se em dois tempos. O 9.º Circuito norte-americano deu razão à hiQ em 2019 (938 F.3d 985) e depois em abril de 2022 (31 F.4th 1180): fazer scraping de perfis públicos levantava, no mínimo, sérias questões à luz do CFAA (Computer Fraud and Abuse Act). A providência a favor da hiQ, decretada logo em 2017, foi mantida.

O desfecho virou-se, porém, contra a hiQ. A 4 de novembro de 2022, o tribunal de primeira instância concluiu que violara os termos de utilização do LinkedIn. A 8 de dezembro de 2022, uma sentença por acordo impôs 500 000 $ e a destruição dos perfis e do código, como detalha o escritório Proskauer. Os juízes afastaram, portanto, o acesso público como defesa contra a violação dos termos de utilização. O alcance deste caso fica por aqui: nenhum juiz francês está vinculado por uma decisão norte-americana.

A Meta ilustra a outra face: a própria plataforma pode pagar. A Data Protection Commission irlandesa adotou em 25 de novembro de 2022 e anunciou a 28 uma coima de 265 milhões de euros contra a Meta Platforms Ireland. A acusação: incumprimento dos n.os 1 e 2 do artigo 25.º do RGPD, sobre a proteção de dados desde a conceção e por defeito. O inquérito incidia sobre a pesquisa do Facebook e sobre os importadores de contactos do Messenger e do Instagram, entre maio de 2018 e setembro de 2019.

Por fim, a Clearview AI. Pela deliberação SAN-2022-019 de 17 de outubro de 2022 (tornada pública a 20 de outubro), listada na tabela de sanções da CNIL, a formação restrita aplicou 20 milhões de euros a esta sociedade de reconhecimento facial. As acusações: falta de base legal, desrespeito do direito de acesso e do direito ao apagamento, falta de cooperação. Acompanhava-a uma injunção sujeita a sanção pecuniária compulsória. A deliberação SAN-2023-005 de 17 de abril de 2023 liquidou essa sanção em 5,2 milhões de euros, por falta de resposta.

Fazer scraping de endereços de email para prospetar

Um endereço como nome.apelido@empresa.fr identifica uma pessoa: entra no campo do RGPD, inclusive em B2B. Neste terreno, a CNIL admite a prospeção por email entre profissionais sem consentimento prévio (artigo L34-5 do Código dos Correios e das Comunicações Eletrónicas francês), com duas condições. O objeto da solicitação tem de estar relacionado com a profissão do destinatário. A pessoa tem também de ter sido informada da utilização do seu endereço e poder opor-se de forma simples e gratuita a cada mensagem (página da CNIL sobre a prospeção por correio eletrónico). Os endereços genéricos de pessoas coletivas (info@, contact@) ficam excluídos do regime.

O segundo risco é técnico. Uma lista obtida por scraping envelhece: os trabalhadores mudam de empresa, algumas caixas fecham, domínios catch-all respondem «aceite» a qualquer endereço. Cada endereço morto produz um hard bounce. Uma taxa elevada de hard bounces degrada a reputação do remetente no Gmail e no Outlook. As mensagens destinadas a contactos válidos ressentem-se também.

Os métodos de recolha de endereços que passam por um formulário ou por uma troca direta limitam este risco por construção. Para uma lista obtida por scraping, falta ainda documentar a prova de consentimento e a anulação da subscrição antes de escrever a quem quer que seja. Passar uma amostra da lista por uma ferramenta de verificação de endereços de email antes da próxima campanha mostra que parte dos endereços é inválida.

APIs oficiais e dados comprados

O caminho mais seguro consiste em usar a API do site: a própria plataforma fixa o perímetro e as quotas. A API só entrega os campos que a plataforma decide abrir, o que limita a prospeção.

Comprar ou alugar dados desloca o problema sem o apagar. O RGPD aplica-se a quem os utiliza; a obrigação de informação mantém-se se as pessoas nunca ouviram falar dele. O detalhe dos riscos consta da nossa análise sobre a compra de listas de emails. Para uma base própria, a construção de uma lista B2B qualificada por canais diretos evita tanto o scraping como a compra.

Perguntas frequentes sobre o scraping de dados

O scraping é ilegal em França?

Não. Passa a sê-lo consoante o que se recolhe: dados pessoais sem base legal nem informação, um espaço privado forçado ou uma base protegida extraída em substância. Um caso concreto merece o parecer de um advogado ou do encarregado da proteção de dados.

Pode fazer-se scraping do LinkedIn ou do X?

Os termos de utilização destas plataformas proíbem o scraping não autorizado. Na Europa, o RGPD soma-se assim que se trate de perfis de pessoas. O detalhe do caso hiQ consta mais acima: é uma decisão norte-americana, que não vincula os juízes europeus.

O robots.txt tem valor jurídico?

Não é uma lei. A CNIL faz dele, no entanto, um sinal claro de oposição: um site que se opõe deve ser excluído da recolha para que o interesse legítimo se sustente.

Que sanções se arriscam?

Consoante a situação: uma coima da autoridade de proteção de dados, uma condenação civil por violação de uma base de dados ou um procedimento penal, nomeadamente por acesso fraudulento a um sistema informático.

Nicolas Forni
Author

Fundador da Captain Verify, trabalho na verificação de emails e números de telemóvel desde 2015. Neste blog escrevo sobre entregabilidade, higiene das bases de contactos, regras dos fornecedores de correio e SMS marketing. Artigos concretos, pensados para as equipas de marketing que enviam todas as semanas.