Добавлены методы getAttributes и getTexts
This commit is contained in:
+47
-2
@@ -92,9 +92,9 @@ class JsonManager:
|
||||
|
||||
|
||||
class Pars:
|
||||
'''Модуль для работы с запросами и HTML файлами во время парсинга'''
|
||||
'''Модуль для работы с запросами и bs4'''
|
||||
|
||||
def returnBs4Object(self, pathToFile: str, encoding: str = 'utf8', parser: str = 'lxml') -> bs4Object:
|
||||
def returnBs4Object(self, pathToFile: str, encoding: str = 'utf8', parser: str = 'lxml'):
|
||||
'''Возвращаем объект beautifulsoup
|
||||
|
||||
pathToFile: путь до html файла
|
||||
@@ -105,6 +105,48 @@ class Pars:
|
||||
soup = BeautifulSoup(src, parser)
|
||||
return soup
|
||||
|
||||
def getTexts(self, arr: list, needFix: bool = 0) -> list:
|
||||
'''Возвращаем текст из элементов bs4
|
||||
|
||||
arr: список объектов bs4 из которых будет извлекаться текст
|
||||
needFix (0/1): если этот параметр установлен как True, то из текста будут удалены \\n, \\t и пробелы с концов'''
|
||||
result = []
|
||||
for item in arr:
|
||||
data = item.text
|
||||
if needFix:
|
||||
data = data.strip()
|
||||
data = data.replace('\t', '')
|
||||
data = data.replace('\n', '')
|
||||
|
||||
if not data:
|
||||
continue
|
||||
result.append(data)
|
||||
|
||||
if not result:
|
||||
return None
|
||||
return result
|
||||
|
||||
def getAttributes(self, arr: list, att: str) -> list:
|
||||
'''Возвращаем список значений атрибутов
|
||||
|
||||
arr: список объектов bs4 из которых будет извлекаться атрибут
|
||||
att: строка с названием атрибута по которому будет осуществляться поиск'''
|
||||
result = []
|
||||
for item in arr:
|
||||
data = item.get(att)
|
||||
if data is not None:
|
||||
result.append(item.get(att))
|
||||
|
||||
if not result:
|
||||
return None
|
||||
return result
|
||||
|
||||
def pprint(self, data: any) -> None:
|
||||
'''Выводим данные в удобочитаемом виде
|
||||
|
||||
data: данные которые надо вывести'''
|
||||
pprint(data)
|
||||
|
||||
def getStaticPage(self, pathToSaveFile: str, url: str, writeMethod: str = 'w', headers: dict = None) -> int:
|
||||
'''Получаем статическую страницу и возвращаем статус ответа от сервера
|
||||
|
||||
@@ -128,6 +170,7 @@ class Pars:
|
||||
src = req.text
|
||||
with open(pathToSaveFile, 'w', encoding='utf-8') as file:
|
||||
file.write(src)
|
||||
|
||||
elif writeMethod == 'wb':
|
||||
src = req.content
|
||||
with open(pathToSaveFile, 'wb') as file:
|
||||
@@ -160,6 +203,7 @@ class Pars:
|
||||
driver.get(url)
|
||||
# Прокручиваем страницу до самого низа
|
||||
lastHeight = driver.execute_script("return document.body.scrollHeight")
|
||||
|
||||
while True:
|
||||
# Прокручиваем до низа страницы
|
||||
driver.execute_script("window.scrollTo(0, document.body.scrollHeight);")
|
||||
@@ -170,6 +214,7 @@ class Pars:
|
||||
if newHeight == lastHeight:
|
||||
break
|
||||
lastHeight = newHeight
|
||||
|
||||
# Получаем HTML-код страницы
|
||||
htmlContent = driver.page_source
|
||||
# Сохраняем HTML-код в файл
|
||||
|
||||
Reference in New Issue
Block a user