get_dummies()
是 Pandas 库中的一个函数,用于进行One-hot编码,将分类变量转换为虚拟变量。
以下是 get_dummies()
函数的一般用法:
pd.get_dummies(data, prefix=None, prefix_sep='_', dummy_na=False, columns=None, drop_first=False)
-
data
:要进行编码的数据,可以是 Series、DataFrame 或其他可迭代对象。 -
prefix
:可选参数,表示生成的虚拟变量的前缀。默认情况下,使用原始的类别名称作为前缀。 -
prefix_sep
:可选参数,表示前缀和原始类别名称之间的分隔符,默认为下划线 '_ '。 -
dummy_na
:可选参数,表示是否生成表示缺失值的虚拟变量。默认为 False。 -
columns
:可选参数,表示要进行编码的列名。如果指定了列名,则只对这些列进行编码,否则对所有列进行编码。 -
drop_first
:可选参数,表示是否删除每个特征的第一个级别,以避免多重共线性问题。默认为 False。
get_dummies()
函数将返回一个新的 DataFrame 对象,其中包含转换后的虚拟变量。
import pandas as pd
data = {'颜色': ['红色', '绿色', '蓝色', '红色']}
df = (data)
# 进行One-hot编码
encoded_df = pd.get_dummies(df['颜色'])
print(encoded_df)
输出结果:
红色 绿色 蓝色
0 1 0 0
1 0 1 0
2 0 0 1
3 1 0 0