Курс Python → Удаление дубликатов в pandas

Для удаления дублирующихся данных в Python можно воспользоваться методом drop_duplicates() из библиотеки pandas. Этот метод позволяет удалить строки с дублирующимися значениями в указанных столбцах. Например, если у вас есть DataFrame df и вы хотите удалить дубликаты в столбце ‘name’, то код будет выглядеть следующим образом:


df.drop_duplicates(subset=['name'], keep='first', inplace=True)

В данном примере мы указали столбец ‘name’ как ключ для поиска дубликатов. Аргумент keep=’first’ означает, что будет оставлен первый встреченный дубликат, а остальные будут удалены. Если вы хотите сохранить последний дубликат, замените ‘first’ на ‘last’.

Если вы хотите удалить дубликаты по всем столбцам, то просто укажите аргумент subset=None:


df.drop_duplicates(subset=None, keep='first', inplace=True)

После выполнения этой операции DataFrame будет содержать только уникальные строки. Удаление дубликатов помогает упростить анализ данных и избежать искажений в результатах. Помните, что перед удалением дубликатов всегда стоит проанализировать данные и убедиться, что удаление не повредит целостности информации.

Твои коллеги будут рады, поделись в

Автор урока

Дмитрий Комаровский
Дмитрий Комаровский

Автоматизация процессов
в КраснодарБанки.ру

Другие уроки курса "Python"

  1. Группировка элементов в словарь
  2. Вложенные функции в Python
  3. Уникальность ключей в словаре
  4. Именование переменных в Python
  5. Обработка исключений в Python
  6. Присвоение и ссылки
  7. Проверка элемента в множестве.
  8. Показ всплывающих окон Tkinter
  9. Создание namedtuple из словаря
  10. Метод rlshift для битового сдвига
  11. Поиск с библиотекой Google
  12. Поиск шаблона в начале строки
  13. Удаление элемента из списка
  14. Python Enum Weekday Usage
  15. Считывание бинарного файла в Python
  16. Управление ресурсами с контекстными менеджерами
  17. Управление памятью в Python
  18. Проверка условий: all и any
  19. ROT13 Шифр Цезаря в Python
  20. Решатель судоку на Python с pygame
  21. Python: динамическая типизация и проверка типов
  22. Проверка версии Python
  23. Исключение NotImplementedError
  24. Работа с контекст-менеджером «with»
  25. List Comprehension Tutorial
  26. Объединение списков в Python
  27. Мониторинг памяти с Pympler
  28. Создание детектора плагиата
  29. Сравнение строк в Python
  30. Декораторы в Python
  31. Отладка кода
  32. Форматирование данных с помощью pprint
  33. Группы исключений в Python
  34. Декораторы в Python
  35. Функция rsplit() в Python
  36. Асинхронное выполнение задач в Python
  37. Иерархия классов в Python
  38. Подсчет количества элементов в списке
  39. Модуль math: основные функции
  40. Работа с модулем random
  41. Отрицательные индексы списков в Python
  42. Оптимизация памяти в Python
  43. Модуль xkcd: добавление юмора в Python
  44. Закрытие файла в Python

Marketello читают маркетологи из крутых компаний