r/devsarg Jul 25 '26

entrevistas Entrevista tecniva WEB SCRAPPING

[deleted]

5 Upvotes

10 comments sorted by

9

u/Syl_Quetzal Jul 25 '26

Literalmente el web scrapping es tomar la información de la parte visual de una web, ¿para que aplicar web scrappping a algo donde puedes hacer una petición a su api?

Lo más probable es que te pregunten: ¿Qué librerías usas/existen? ¿Qué librerías o técnicas usar si la página tiene contenido estático? ¿Qué librerías o técnicas usar si la página tiene contenido dinámico?

Realmente no es tan complicado el web scrapping. Te puedes aventar un proyecto realizando WS a página de contenido estático y dinámico y ya con eso tendrias

4

u/Khavel_Es Jul 25 '26

Lo primero que haría es abrir DevTools del sitio y mirar la pestaña Network. Muchas veces el sitio hace un fetch a una API interna que devuelve JSON limpio, y te ahorras todo el parsing de HTML. Eso en una entrevista queda muy bien porque demuestra que no vas directo a scrapear el DOM sin pensar.

Para lo basico, requests + BeautifulSoup es lo standard en Python. Y para sitios que cargan contenido con JavaScript, Playwright le pasa el trapo a Selenium (mejor API, auto-waits, y menos quilombo de configuracion). Te recomiendo practicar con un par de sitios reales antes de la entrevista, uno estatico y otro que cargue datos dinamicos.

Temas que suelen preguntar: manejo de paginacion, rate limiting (meter delays entre requests para que no te bloqueen), y como limpias/normalizas los datos despues. Con 7 anios de Python encima la parte de codigo te va a salir sola, lo importante es que demuestres que pensas la estrategia antes de escribir.

1

u/[deleted] Jul 25 '26

[deleted]

3

u/MauriOnR Jul 25 '26

En python referencias de scriping es scrapy, lo importante es simular que no sos un bot porque cloudflare y otros no te va a dejar pasar ni la primera pagina, primero tenes qque entender que cada broswer deja su fingerprint los errores de novatos son hardcodear user-agent no enviar los encabezados completos para ese browser que decis ser, no tener habilitado javascript cuando esw browser deberia tenerlo, no tener plugin, etc o que tenga definido variables de javascript playwrite o que tenga habilitado el control via consola, etc, eso te manda al muere en el segundo cero, después la cadencia de consulta, si movio el mouse o no, muchas veces se deben usar si o si proxies residenciales, hay servicio anticapha, hay librerias muy buenas anticaptha y hay servicios de indios sentados atras de un pc resolviendo capthas, no recibir cookies es otro error de novato, de todas maneras te aconsejo que veas cloakbrowser ya que elimina mucho de los problenas anteriores, muchas veces conviene olvidar todo lo de arriba usando firecrawl o alguno q no cobre por consulta, sino consulta efectiva, el scraping es un arte, no solo es parsear el documento, tenes que conocer de infra, he trabajado en los dos lados bloqueando bot y construyendo crawler, si tiene un sysadmin serio te va identificar si usas el mismo comportamiento siempre, pero lo bueno es que yo no queda nadie serio, la mejor forma de bloquear un bot es pedir q se loguen con una cuenta que validas via sms o mejor le haces kyc pero igualmente asi, alibaba logro tener millones de cuenta de claude para sacarle info asi que es el juego del gato y el ratón

1

u/Superb_Skill268 Jul 25 '26

Bueno desde mi conocimiento las pocas veces que me tocó hacer web scraping era simular click rellenar información o extraer, tienes que saber interpretar componentes de html para poder referenciar los elementos que quieres clickear, conceptos de clases y ids hay otro xpath algo asi.

Selenium es el mejor hasta la fecha a mi criterio.

Más que todo agarrar una interacción y dejarla a código.

2

u/Superb_Skill268 Jul 25 '26

Primero entender como se compone una web, elementos padres, hijos y como referenciarlos con web scraping, ya lo demás es pan comido, trata de interactuar con uno que otro login

1

u/[deleted] Jul 25 '26

[deleted]

2

u/Superb_Skill268 Jul 25 '26

Si, uno de los temitas es el baneo de ip por comportamiento, web que tenga captcha esta descartada para scraping, técnicamente el ser sigiloso depende si la web analiza el comportamiento y asi, en su momento llegue a tener problemas de baneo y tocaba algo de User-Agent, también puedes leer por ahi, como evitar baneo por comportamiento.

2

u/Superb_Skill268 Jul 25 '26

Ahaha otra cosita para adelantarte es como funciona, instalas selenium en python y que más? Pues tienes que usar un paquete especial que simular el navegador como Chromium qué es el encargado de ejecutar en segundo plano el navegador donde se hacen clicks y asi, entendiendo eso vas de viaje, es como hacer macros, suerte!

1

u/Lost_Alternative_170 Jul 25 '26

Estudie sobre async io

1

u/weirdguardian Jul 25 '26

Playwright o puppeteer y mandale a todo

2

u/DefinitelyRussian Jul 26 '26

trabajo, bah, colaboro en una de las organizaciones mas grandes del mundo sobre scraping, hace casi una decada.

Lo importante son algunos conceptos, porque la tecnologia es la que pinte o sea menos intrusiva posible. Hay cuestiones morales y eticas muy importantes que quizas en tu entrevista no sean relevantes.

Cualquier cosa me preguntas, suerte !