get_dummies用法

时间:2025-03-15 11:39:43

get_dummies() 是 Pandas 库中的一个函数,用于进行One-hot编码,将分类变量转换为虚拟变量。

以下是 get_dummies() 函数的一般用法:

pd.get_dummies(data, prefix=None, prefix_sep='_', dummy_na=False, columns=None, drop_first=False)
  • data:要进行编码的数据,可以是 Series、DataFrame 或其他可迭代对象。
  • prefix:可选参数,表示生成的虚拟变量的前缀。默认情况下,使用原始的类别名称作为前缀。
  • prefix_sep:可选参数,表示前缀和原始类别名称之间的分隔符,默认为下划线 '_ '。
  • dummy_na:可选参数,表示是否生成表示缺失值的虚拟变量。默认为 False。
  • columns:可选参数,表示要进行编码的列名。如果指定了列名,则只对这些列进行编码,否则对所有列进行编码。
  • drop_first:可选参数,表示是否删除每个特征的第一个级别,以避免多重共线性问题。默认为 False。

get_dummies() 函数将返回一个新的 DataFrame 对象,其中包含转换后的虚拟变量。

import pandas as pd

data = {'颜色': ['红色', '绿色', '蓝色', '红色']}
df = (data)

# 进行One-hot编码
encoded_df = pd.get_dummies(df['颜色'])

print(encoded_df)

输出结果:

   红色  绿色  蓝色
0   1   0   0
1   0   1   0
2   0   0   1
3   1   0   0