Курс Python → Beautiful Soup — извлечение данных из HTML

Beautiful Soup — это удобная Python-библиотека, которая используется для извлечения данных из HTML и XML-файлов. Когда вы работаете с веб-страницами, часто бывает необходимо извлечь определенную информацию, и именно в этом поможет Beautiful Soup. Она позволяет проводить разбор HTML-кода и находить нужные элементы для дальнейшей обработки.

Основное преимущество Beautiful Soup заключается в том, что она предоставляет простые методы для навигации по дереву HTML-кода. Вы можете легко находить нужные теги, атрибуты, текстовые данные и многое другое. Кроме того, библиотека позволяет проводить изменения в структуре разбора, что делает ее очень гибкой и удобной в использовании.

Одной из ключевых особенностей Beautiful Soup является ее способность обрабатывать даже сломанный HTML. Веб-страницы могут содержать ошибки в разметке, неправильно закрытые теги и другие проблемы, но это не станет преградой для библиотеки. Она все равно сможет извлечь нужные данные, что делает ее незаменимым инструментом при парсинге веб-страниц.

from bs4 import BeautifulSoup
import requests

# Получаем HTML-код страницы
url = 'https://www.example.com'
response = requests.get(url)
html = response.text

# Создаем объект Beautiful Soup
soup = BeautifulSoup(html, 'html.parser')

# Ищем все теги 
links = soup.find_all('a')

# Выводим найденные ссылки
for link in links:
    print(link.get('href'))

В приведенном выше примере кода мы используем Beautiful Soup для парсинга HTML-кода веб-страницы. Мы отправляем запрос на указанный URL, получаем HTML-код страницы и затем создаем объект Beautiful Soup. Далее мы ищем все теги (ссылки) и выводим их адреса. Таким образом, с помощью библиотеки легко можно извлечь нужные данные и провести необходимую обработку.

Твои коллеги будут рады, поделись в

Другие уроки курса "Python"

  1. Метод rrshift для пользовательских объектов
  2. Печать комбинаций в Python с Itertools
  3. Анонимные функции в Python
  4. Работа с комплексными числами в Python
  5. Просмотр файла в Jupyter Noteboo
  6. Тестирование с unittest
  7. Метод is_absolute() для PurePath
  8. Работа с CSV файлами
  9. Расчет времени выполнения
  10. Подсчет элементов в списке с Counter
  11. Пространство имен в Python
  12. Добавление элемента в список.
  13. Библиотека wikipedia для Python
  14. Роль ключевого слова self
  15. Безопасные SQL-запросы в Python 3.11
  16. Множественное присваивание в Python
  17. Проверка кортежей.
  18. Дефолтные параметры в Python
  19. Логирование с Loguru
  20. Асинхронное программирование с asyncio
  21. Основы Python за 14 дней
  22. Логирование с Loguru
  23. Генератор надежных паролей
  24. Управление ресурсами в Python
  25. Изменение списка срезом
  26. Измерение времени выполнения кода в Python
  27. Применение функции к списку
  28. Генерация случайных чисел Python
  29. %pinfo: получение информации об объекте
  30. Форматирование строк в Python
  31. Работа с срезами в Python
  32. capitalize() — изменение регистра первого символа строки
  33. Оптимизация строк в Python
  34. Оператор continue в Python
  35. Python Enum Weekday Usage
  36. Форматирование вывода списков
  37. Удаление эмодзи с помощью pandas
  38. Импорт модулей в Python 3.12
  39. Генераторы данных
  40. Путь к интерпретатору Python
  41. Извлечение аудио из видео
  42. Модуль xkcd: добавление юмора в Python
  43. Метод matmul для умножения матриц
  44. Управление виртуальными окружениями в Python
  45. Настройка шрифта и цвета в Tkinter
  46. Форматирование строк в Python

Marketello читают маркетологи из крутых компаний