课程介绍
学习路径
讲师团队
常见问题
适合人群
- 希望系统学习完整技术路径的学员
- 希望把零散知识整理为阶段化能力结构的开发者
- 需要长期自学节奏和清晰课程顺序的人群
学习目标
- 掌握阶段1:BI可视化+sql+Excel相关的核心知识与实践能力
- 掌握阶段2:Python基础+爬虫+数据处理相关的核心知识与实践能力
- 掌握阶段3:大数据+机器学习+就业指导相关的核心知识与实践能力
详细介绍
该课程主要讲解了自动化爬虫的基本概念、使用方法及实践操作。通过具体案例,详细介绍了如何利用Python的`DurationPage`库模拟浏览器行为进行网页数据抓取,并重点讲述了标签获取与解析的方法。主要内容包括:1. **自动化爬虫简介**:区别于传统请求方式,自动化爬虫能够更灵活地模拟用户操作。2. **基本操作**:- 打开指定页面- 获取页面源代码3. **标签获取方法**:- 通过选择器(如CSS选择器)获取标签- 使用`iloc`和`loc`进行行索引和列索引4. **数据处理与运算**:- 处理空值(NaN):使用`isna()`和`notna()`筛选,`dropna()`删除或填充空值。- 填充空值:使用`fillna()`方法进行指定值填充。5. **文件读写操作**:- 使用`read_excel`, `read_csv`等函数读取Excel和CSV文件,并处理空值、分隔符等问题。- 利用`to_excel`, `to_csv`进行数据的保存,支持指定列索引和行索引。
