mirror of
https://github.com/KUlishevgeniy/c22712.git
synced 2026-09-24 08:00:22 +00:00
задание
This commit is contained in:
+2
-3
@@ -4,19 +4,18 @@ from bs4 import BeautifulSoup
|
|||||||
from selenium.webdriver import Chrome
|
from selenium.webdriver import Chrome
|
||||||
from selenium import webdriver
|
from selenium import webdriver
|
||||||
from selenium.webdriver.chrome.service import Service
|
from selenium.webdriver.chrome.service import Service
|
||||||
|
import time
|
||||||
|
|
||||||
# Selenium - библиотека для автоматизации действий веб браузера, скрапинга
|
# Selenium - библиотека для автоматизации действий веб браузера, скрапинга
|
||||||
# запускаем браузер
|
# запускаем браузер
|
||||||
s = Service('C:\data\hrome\chromedriver.exe')
|
s = Service('C:\data\hrome\chromedriver.exe')
|
||||||
browser = webdriver.Chrome(service=s)
|
browser = webdriver.Chrome(service=s)
|
||||||
browser.get('https://www.kinopoisk.ru/lists/movies/top250/')
|
browser.get('https://www.kinopoisk.ru/lists/movies/top250/')
|
||||||
|
time.sleep (10)#задержка для ввода капчи
|
||||||
html_text = browser.page_source
|
html_text = browser.page_source
|
||||||
soup = BeautifulSoup(html_text, 'lxml')
|
soup = BeautifulSoup(html_text, 'lxml')
|
||||||
films=soup.find_all('div', class_='base-movie-main-info_mainInfo__ZL_u3')
|
films=soup.find_all('div', class_='base-movie-main-info_mainInfo__ZL_u3')
|
||||||
print (films[0].text)
|
print (films[0].text)
|
||||||
|
|
||||||
# Это пример парсинга. Вам необходимо спарсить 1 страницу каталога любого сайта на выбор.
|
|
||||||
#сайты не должны повторяться
|
|
||||||
# Спарсить необходимо только Заголовки и описание.
|
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user