이번엔 selenium을 이용해 네이버 홈페이지에서 크롤링을 해볼려고 한다.
왜 굳이 selenium으로 하냐하면, requests와 selenium의 차이점이 있는데 requests는 정적 HTML만 가져오고, javascript로 동적으로 추가되는 콘텐츠는 포함되지 않는다.
반면 selenium은 실제 브라우저에서 페이지를 렌더링해서 동적 콘텐츠가 포함된 최종 HTML을 가져온다.
특히 네이버 같은 경우는 동적 콘텐츠가 굉장히 많은 편이다.
이 압도적인 정보량의 차이를 봐라. ㅋㅋ

원래는 웹툰 제목을 크롤링할 생각이었다.
그런데 아무리 find_all()로 찾아봐도 안 보여서 물 건너갔다.

그나마 재미있어 보이는걸 찾았다. 대충 인터넷뉴스 제목 같은데 이것을 긁어보자.

이전 글에서 한 것처럼 class 정보를 이용해 text로 출력하면 된다.

'Upstage AI Lab 6기' 카테고리의 다른 글
| Upstage AI Lab 6기 Python 강의 후기 (0) | 2024.11.26 |
|---|---|
| 크롤링 (API, json) (0) | 2024.11.25 |
| 웹크롤링 (BeautifulSoup) (0) | 2024.11.22 |
| Jupyter notebook 쓸 때 팁 (2) | 2024.11.20 |
| Data Scientist 마인드셋 특강 후기 (4) | 2024.11.16 |