¿Alguna vez te has preguntado cómo una empresa puede recopilar miles de datos de internet en poco tiempo? Detrás de esto existe una técnica llamada web scraping
El web scraping es una técnica de inteligencia de fuentes abiertas (OSINT, por sus siglas en inglés) que permite automatizar la extracción y análisis de grandes cantidades de información disponible en internet. Las empresas pueden utilizar herramientas, extensiones o bibliotecas para recopilar datos de sitios web y redes sociales, por ejemplo, para analizar precios, detectar tendencias, estudiar a la competencia o conocer el posicionamiento de una marca.
Sin embargo, que una información esté publicada en internet no significa automáticamente que sea legal utilizarla para cualquier propósito.
De acuerdo con ESET, el uso de herramientas de scraping no es ilegal por sí mismo. La legalidad depende, entre otros factores, del propósito y del tipo de información que se recopila. Por ejemplo, una empresa podría obtener los precios que otra compañía publica en su marketplace para realizar un análisis de mercado. El problema aparece cuando estas técnicas se utilizan para recopilar datos personales, información sensible o propiedad intelectual y posteriormente utilizarlos con fines indebidos.
“En teoría, el uso de herramientas, extensiones o bibliotecas de scraping no es ilegal. Sin embargo, esto depende del propósito y del uso que se haga de esta información”, explica David González, investigador de Seguridad Informática de ESET Latinoamérica.
Además, que los datos sean accesibles públicamente no significa que su recopilación, almacenamiento, publicación o uso posterior sea necesariamente legal o ético. Las empresas deben considerar las leyes de protección de datos y otras obligaciones aplicables.
Usos más pupulares de los scrapers:
- Monitoreo de precios
- Contenido de redes sociales
- Noticias especializadas del sector
Según la plataforma Radar de Cloudflare, el tráfico generado por bots superó al tráfico web humano, con un 57% del tráfico impulsado por bots, frente al 42% impulsado por humanos hasta junio de 2026. Además, según el Thales Bad Bot Report 2026, el tráfico malicioso de bots representó aproximadamente el 40% del tráfico total de bots en 2025.
Una recopilación automatizada de información puede convertirse en un problema serio cuando se utiliza con fines maliciosos. Estos son varios riesgos que identifican:
- Violación de privacidad: los atacantes pueden recopilar datos personales sin el consentimiento de sus propietarios, incluso cuando esa información fue publicada públicamente.
- Frudes y estafas: los datos obtenidos pueden utilizarse para crear perfiles falsos y hacer que ataques de phishing, spearphishing e ingeniería social sean mucho más personalizados.
- Impacto en el rendimiento de los sitios objeto de scraping: al acceder y consumir recursos de portales o redes sociales, el aumento del tráfico web puede afectar negativamente el rendimiento de los recursos web, provocando que los sitios se vuelvan más lentos o queden temporalmente fuera de servicio.
- Daño en la reputación: la obtención de datos personales puede utilizarse con fines maliciosos, como perjudicar la reputación de una empresa, lo que puede llevar a una pérdida de clientes debido a la desconfianza sobre cómo se expuso y recopiló esa información. Esto puede tener un impacto duradero tanto en cuestiones legales como financieras.
Es recomendable implementar diferentes medidas para reducir el impacto del scraping malicioso:
- Bloqueo de direcciones IP: monitorear el tráfico para detectar comportamientos inusuales y bloquear direcciones que generen actividad sospechosa.
- Configuración correcta del archivo “robots.txt”: la mayoría de las páginas en internet contienen un archivo llamado “robots.txt”, que indica a motores de búsqueda como Google o Bing qué recursos pueden acceder desde la página web. Por ejemplo, permite controlar el acceso a archivos de imágenes o bloquear el acceso a recursos o directorios que pueden ser privados, otorgando un mejor control. En el caso de los scrapers, estos pueden ser restringidos mediante este archivo.
- Filtrado de solicitudes mediante agentes: analizar información como el user agent, la IP, el navegador o el sistema operativo para detectar solicitudes sospechosas.
- Uso de CAPTCHA: CAPTCHA es el acrónimo de “prueba pública de Turing completamente automatizada para distinguir entre computadoras y humanos”. Esta prueba de seguridad se utiliza para verificar que un usuario es humano y no un bot o programa automatizado, lo que impediría que un scraper obtenga grandes volúmenes de información de manera tan rápida y sencilla.
- Uso de honeypots: en TI, una práctica común consiste en crear servicios falsos, como un servidor web o una base de datos, que aparentan ser vulnerables a ataques. Cuando los ciberdelincuentes caen en la trampa y atacan, los honeypots recopilan y analizan los datos del ataque. La información obtenida se utiliza para conocer mejor los ataques y su origen. Esto ayuda a preparar los sistemas reales frente a posibles amenazas como los scrapers.
- Higiene digital y concientización: los buenos hábitos en el mundo digital permiten a los usuarios proteger la información personal frente a amenazas cibernéticas, entre ellas publicar únicamente la información mínima necesaria en las páginas oficiales para que la empresa pueda continuar operando.

El web scraping permite recopilar grandes cantidades de información de internet, pero también puede ser utilizado por ciberdelincuentes para obtener datos sensibles.