



本书通过对数据科学技术基本技能和丰富实用的示例的介绍,展示如何获取、分析和可视化数据,利用数据应对常见的业务挑战。通过优化共享单车公司的业务运营、从网站上提取数据并创建推荐系统等示例,你将学会如何找到数据驱动的解决方案并使用这些方案做出商业决策。本书所涵盖的内容包括进行探索性数据分析、运行 A/B 测试、使用逻辑回归模型进行二分类及使用机器学习算法等。通过本书,你还将学习如何预测客户需求、优化营销活动、减少客户流失、预测网站流量,以及构建推荐系统等。
第1章 探索性数据分析
1.1 作为CEO的第一天
1.2 用Python显示数据
1.3 计算汇总统计信息
1.4 分析数据子集
1.5 使用Matplotlib进行数据可视化
1.6 探索相关性
1.7 创建热力图
1.8 进一步探索
1.9 本章小结
第2章 预测
2.1 预测客户需求
2.2 清洗错误数据
2.3 使用数据绘图从而发现趋势
2.4 执行线性回归
2.5 使用回归预测未来趋势
2.6 尝试更多的回归模型
2.7 选择用于预测的最佳回归模型
2.8 进一步探索
2.9 本章小结
第3章 分组比较
3.1 读取总体数据
3.2 进行假设检验
3.3 在实际环境中进行组间比较
3.4 本章小结
第4章 A/B测试
4.1 实验的必要性
4.2 运行实验来检验新的假设
4.3 优化冠军/挑战者框架
4.4 用泰曼定律和A/A测试预防错误
4.5 理解效应值
4.6 计算数据的显著性
4.7 应用及注意事项
4.8 A/B测试的伦理问题
4.9 本章小结
第5章 二分类算法
5.1 减少客户流失
5.2 利用线性概率模型发现高流失风险客户
5.3 用逻辑回归预测二分类结果
5.4 二分类的应用
5.5 本章小结
第6章 监督学习
6.1 预测网站流量
6.2 读取并绘制文章数据
6.3 使用线性回归作为预测方法
6.4 理解监督学习
6.5 k近邻
6.6 使用其他监督学习算法
6.7 测量预测准确性的指标
6.8 使用多变量模型
6.9 使用分类代替回归
6.10 本章小结
第7章 无监督学习
7.1 无监督学习与监督学习
7.2 生成和探索数据
7.3 聚类观测的来源
7.4 实际业务中的聚类
7.5 分析多维数据
7.6 EM聚类
7.7 其他聚类方法
7.8 其他无监督学习方法
7.9 本章小结
第8章 网络爬取
8.1 理解网站是如何运行的
8.2 创建第一个网页爬虫
8.3 解析HTML代码
8.4 使用正则表达式执行搜索
8.5 使用正则表达式搜索电子邮件地址
8.6 将爬取的结果转换为可用数据
8.7 使用Beautiful Soup
8.8 高级爬取
8.9 本章小结
第9章 推荐系统
9.1 基于人气的推荐
9.2 基于商品的协同过滤
9.3 基于用户的协同过滤
9.4 案例研究:音乐推荐
9.5 用高级系统生成推荐
9.6 本章小结
第10章 自然语言处理
10.1 使用NLP技术检测抄袭
10.2 理解word2vec NLP模型
10.3 word2vec中的数值向量分析
10.4 使用skip-thoughts
10.5 主题建模
10.6 其他NLP应用
10.7 本章小结
第11章 其他语言中的数据科学
11.1 用SQL赢得足球比赛
11.2 用R赢得足球比赛
11.3 获得其他有价值的技能
11.4 本章小结
点击下载