Pandas¶
数据清洗、分组聚合、时间序列
核心 API¶
DataFrame/Series— 基本数据结构groupby+agg— 分组聚合merge/join— 表连接pivot_table— 透视表read_csv/read_excel/read_json— 数据读取
进阶¶
apply性能陷阱与向量化替代方案swifter加速 applypd.eval()/pd.query()— 表达式求值优化- 大数据处理:
chunksize分块 /Dask/Polars
练习¶
- 完成 Kaggle Pandas 微课程
- 在 Kaggle Titanic 中用 Pandas 完成数据清洗
- 对比
apply与向量化操作的性能差异
资源¶
| 资源 | 链接 |
|---|---|
| Kaggle Pandas 微课程 | https://www.kaggle.com/learn/pandas |
| 《Python for Data Analysis》 | https://wesmckinney.com/book/ |
| Pandas 官方文档 | https://pandas.pydata.org/docs/ |