Курс Python → Парсинг веб-страниц с Beautiful Soup

Веб-парсинг — это процесс извлечения данных с веб-страниц с целью их анализа или использования в других приложениях. Для этой задачи существует множество библиотек на Python, одними из самых популярных являются Beautiful Soup и Scrapy.

Beautiful Soup — это библиотека, которая позволяет удобно парсить HTML и XML документы. Она предоставляет простой интерфейс для навигации по дереву HTML и извлечения нужных данных. Например, с помощью Beautiful Soup можно легко найти все ссылки на странице или извлечь текст из определенных тегов.

Scrapy — это более мощный инструмент для веб-парсинга, который позволяет создавать полноценные веб-пауки для автоматического сбора данных с нескольких страниц или сайтов. С его помощью можно настраивать правила извлечения данных, обходить различные ограничения и сохранять результаты в нужном формате.

Давайте рассмотрим пример использования Beautiful Soup для получения значения валюты по сравнению с долларом США. Допустим, у нас есть HTML страница с курсами валют, и нам нужно извлечь значение валюты по отношению к доллару. Мы можем использовать Beautiful Soup для поиска нужной информации в HTML коде и извлечения ее. Пример кода может выглядеть следующим образом:

from bs4 import BeautifulSoup
import requests

url = 'https://example.com/currency'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

currency_value = soup.find('span', {'class': 'currency-value'}).text
print(currency_value)

В данном примере мы отправляем GET запрос на страницу с курсами валют, загружаем HTML код, создаем объект Beautiful Soup и используем метод find для поиска элемента с определенным классом. Затем мы извлекаем текст из этого элемента и выводим его на экран. Таким образом, мы можем легко получить нужные данные с веб-страницы с помощью Python и Beautiful Soup.

Твои коллеги будут рады, поделись в

Автор урока

Дмитрий Комаровский
Дмитрий Комаровский

Автоматизация процессов
в КраснодарБанки.ру

Другие уроки курса "Python"

  1. Генераторы списков
  2. Создание новых списков через list comprehensions
  3. Получение текущей даты в Python
  4. Форматирование данных с помощью pprint
  5. Декораторы в Python
  6. Выборка чисел
  7. Именование переменных в Python
  8. Python union() функция — объединение множеств
  9. Поиск элементов BeautifulSoup
  10. Делегирование в Python
  11. Объединение множеств в Python
  12. Преобразование объекта в строку
  13. Определение основы слова с showballstemmer
  14. Модуль xkcd: добавление юмора в Python
  15. Создание задания в Cron
  16. Разделение строк в Python
  17. Сравнение строк в Python
  18. Работа с атрибутом dict
  19. Обход словаря в Python
  20. Работа с enumerate()
  21. Оператор is в Python
  22. Метод rsub в Python: расширение функциональности вычитания
  23. Преобразование строк в числа в Python
  24. Раздувающийся словарь в Python
  25. Операторы += в Python
  26. Оператор Walrus: правильное использование
  27. Однострочники Python
  28. Операции с матрицами в Python
  29. Хешируемые ключи в Python
  30. Функция enumerate() — Python
  31. Функция enumerate в Python
  32. Печать месячного календаря
  33. Генераторы в Python
  34. Закрытие файла в Python
  35. Получение списка файлов в директории с использованием os
  36. Подсчет элементов в Python
  37. Замена текста в Python
  38. Декораторы в Python
  39. Оператор assert в Python
  40. Декодирование строк в Python
  41. PUT запрос для обновления данных
  42. Форматирование кода на Python
  43. Операции с датами в Python
  44. Просмотр атрибутов и методов класса
  45. Работа с контекстными менеджерами

Marketello читают маркетологи из крутых компаний