This commit is contained in:
Harutyun
2023-02-17 00:50:26 +03:00
17 changed files with 100 additions and 7 deletions
-1
View File
@@ -1 +0,0 @@
Ок
+16 -2
View File
@@ -1,4 +1,18 @@
print('Hello, world!')
from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.chrome.service import Service
import time
S = Service('D:\teach\Prog\chromedriver.exe') #Открыли драйвер для хрома
browser = webdriver.Chrome(service=S) #Инициировали в отдельную переменную
browser.get('https://www.kinopoisk.ru/lists/movies/top250/')
html_text = browser.page_source
time.sleep(20)
soup = BeautifulSoup(html_text, 'lxml')
films = soup.find_all('div', class_='base-movie-main-info_mainInfo__ZL_u3')
'''
Пу пу пу
print(soup)
print(films)
'''
for film in films:
print(film.text)
+1
View File
@@ -0,0 +1 @@
Тестовый файл
+1
View File
@@ -0,0 +1 @@
Hello World!
+1
View File
@@ -0,0 +1 @@
print('Hello, World!')
+1
View File
@@ -0,0 +1 @@
test
+1
View File
@@ -0,0 +1 @@
print("Hello, world!")
+1
View File
@@ -0,0 +1 @@
test
+14
View File
@@ -0,0 +1,14 @@
from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.chrome.service import Service
from time import sleep
s = Service("С:\DATA\ChromeDriver\chromedriver.exe")
browser = webdriver.Chrome(service=s)
browser.get("https://www.kinopoisk.ru/lists/movies/top250/")
sleep(15)
html_text = browser.page_source
soup = BeautifulSoup(html_text, 'lxml')
films = soup.find_all('div', class_="desktop-list-main-info_secondaryTitleSlot__mc0mI")
for film in films:
print(film.text)
print("--------")
+1
View File
@@ -0,0 +1 @@
hello world
+1
View File
@@ -0,0 +1 @@
eijdieid
+1
View File
@@ -0,0 +1 @@
ghg
+1
View File
@@ -0,0 +1 @@
hello!!
+40
View File
@@ -0,0 +1,40 @@
# установи python, pip
# выполни эту команду: pip install selenium bs4 lxml
# если ты используешь pycharm, то надо библиотеки ставить не в консоли(терминале), а в самом pycharm
# для этого нажми "view" > "tool windows" > "python packages"
# внизу в окне поиска ищи нужные библиотеки
# когда найдешь, нажимай на нее, справа будет кнопка "install package", устанавливай, потом перезапусти pycharm
# найди версию своего браузера
# напиши в гугле "скачать драйвер для <название и версия твоего браузера> selenium"
# теперь все готово для запуска этого
# помните, что сам сайт(который вы хотите парсить) может вас блокировать или заставлять проходить capture, из-за чего этот код ничего не выведет
from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.chrome.service import Service
# импортируем всё нужное
s = Service("путь_до_драйвера") # в ковычках указываем полный путь до скаченного ранее драйвера
# если ты на винде, то вместо знака "\" пиши "\\"
brow = webdriver.Chrome(service=s) # как будто создаем виртуальный браузер
brow.get("https://www.revshells.com/") # получаем html код сайта и другую информацию(она нам не нужна сейчас)
html = brow.page_source # копируем html код в переменную
soup = BeautifulSoup(html, "lxml") # создаем специальный парсер
buttons = soup.find_all(attrs={"class": "list-group-item list-group-item-action"})
# получаем список всех html тегов, в которых есть атрибут "class", равный: "list-group-item list-group-item-action"
for button in buttons:
# выводим текст каждого тега
print(button.text)
# от сердца и почек
# дарю вам питончик
# made by perfecto
@@ -1 +0,0 @@
Check this out: https://t.me/by_perfecto
+1 -1
View File
@@ -1 +1 @@
7y08y bp89u98 bpuih
def print_hi(' hello')