Pandas实战100例 | 案例 66: 字符串提取

案例 66: 字符串提取

知识点讲解

Pandas 提供了强大的字符串处理功能,其中包括从字符串中提取特定模式的能力。使用正则表达式,你可以从文本列中提取数字、单词或其他模式。

  • 字符串提取: 使用 str.extract 方法结合正则表达式,可以从字符串列中提取匹配模式的部分。在这个例子中,我们使用 \d+ 来提取连续的数字。
示例代码
# 准备数据和示例代码的运行结果,用于案例 66# 示例数据
data_string_extraction = {'Text': ['Item1-100', 'Item2-200', 'Item3-300']
}
df_string_extraction = pd.DataFrame(data_string_extraction)# 字符串提取
df_string_extraction['Extracted'] = df_string_extraction['Text'].str.extract('(\d+)')df_string_extraction

在这个示例中,我们从 Text 列的每个字符串中提取了数字。

示例代码运行结果
        Text Extracted
0  Item1-100       100
1  Item2-200       200
2  Item3-300       300

这个结果显示了提取后的数字。请注意,提取的数字被识别为字符串。字符串提取功能在数据清洗和预处理中非常有用,特别是当需要从文本数据中提取特定信息时。