Python爬虫数据存储与可视化分析
爬取到的数据如何存储与可视化分析?本文将教你使用Python将爬虫数据存储到数据库,并通过图表展示分析结果,让你的数据更加直观易懂!
引言 / 什么是爬虫数据存储与可视化分析
在当今数据驱动的时代,网络爬虫已成为获取公开数据的重要工具。但仅获取数据远不够——如何高效存储并从中提取价值才是关键。例如,电商网站的价格监控需要长期存储商品数据,并通过折线图观察价格波动;新闻网站的内容分析需要存储文章并生成词云图展示热点关键词。
本文将系统讲解Python爬虫数据的完整处理流程:从数据存储(MySQL/MongoDB)到可视化分析(Matplotlib/Seaborn),并通过真实案例演示如何将爬取的豆瓣电影数据存储到数据库,并用图表展示评分分布与年份趋势。
准备工作
环境配置:
- Python 3.6+
- 数据库:MySQL 8.0 或 MongoDB 5.0
- 库安装:
pip install pymysql pymongo matplotlib seaborn pandas requests
数据源准备:
- 示例使用豆瓣电影Top250页面(
https://movie.douban.com/top250) - 需处理分页逻辑与反爬机制(如设置
User-Agent和延迟)
- 示例使用豆瓣电影Top250页面(
核心数据存储方案
方案一:关系型数据库(MySQL)
适用场景:结构化数据、需要复杂查询(如按年份筛选电影)
import pymysql
from pymysql.cursors import DictCursor
# 创建数据库连接
conn = pymysql.connect(
host='localhost',
user='root',
password='your_password',
database='spider_db',
charset='utf8mb4',
cursorclass=DictCursor
)
# 创建表
with conn.cursor() as cursor:
cursor.execute("""
CREATE TABLE IF NOT EXISTS movies (
id INT AUTO_INCREMENT PRIMARY KEY,
title VARCHAR(100) NOT NULL,
rating FLOAT,
year INT,
directors VARCHAR(200),
quote TEXT
)
""")
conn.commit()
数据插入示例:
def save_to_mysql(movie_data):
with conn.cursor() as cursor:
sql = """
INSERT INTO movies (title, rating, year, directors, quote)
VALUES (%s, %s, %s, %s, %s)
"""
cursor.execute(sql, (
movie_data['title'],
movie_data['rating'],
movie_data['year'],
','.join(movie_data['directors']),
movie_data['quote']
))
conn.commit()
方案二:非关系型数据库(MongoDB)
适用场景:半结构化数据、快速开发(如存储包含嵌套字段的JSON数据)
from pymongo import MongoClient
# 连接MongoDB
client = MongoClient('mongodb://localhost:27017/')
db = client['spider_db']
collection = db['movies']
# 插入文档
def save_to_mongo(movie_data):
collection.insert_one({
'title': movie_data['title'],
'rating': movie_data['rating'],
'year': movie_data['year'],
'directors': movie_data['directors'],
'quote': movie_data['quote'],
'crawl_time': datetime.now()
})
对比表格:
| 特性 | MySQL | MongoDB |
|---|---|---|
| 数据模型 | 表格(行和列) | 文档(JSON格式) |
| 查询语言 | SQL | MongoDB查询语法 |
| 事务支持 | ACID兼容 | 4.0+支持多文档事务 |
| 最佳场景 | 金融交易、报表系统 | 日志分析、内容管理系统 |
数据可视化分析实战
基础图表绘制(Matplotlib)
场景:展示豆瓣电影评分分布
import matplotlib.pyplot as plt
import pandas as pd
# 从MySQL读取数据
def load_from_mysql():
with conn.cursor() as cursor:
cursor.execute("SELECT rating FROM movies")
ratings = [row['rating'] for row in cursor.fetchall()]
return ratings
ratings = load_from_mysql()
# 绘制直方图
plt.figure(figsize=(10, 6))
plt.hist(ratings, bins=10, edgecolor='black', alpha=0.7)
plt.title('豆瓣电影评分分布', fontsize=16)
plt.xlabel('评分', fontsize=12)
plt.ylabel('电影数量', fontsize=12)
plt.grid(axis='y', alpha=0.3)
plt.show()
高级可视化(Seaborn)
场景:分析电影年份与评分的关系
import seaborn as sns
# 从MongoDB读取数据并转换为DataFrame
def load_from_mongo():
docs = list(collection.find({}, {'year': 1, 'rating': 1}))
return pd.DataFrame(docs)
df = load_from_mongo()
# 绘制箱线图
plt.figure(figsize=(12, 6))
sns.boxplot(x='year', y='rating', data=df[df['year'] > 1990])
plt.title('1990年后电影评分年份分布', fontsize=16)
plt.xticks(rotation=45)
plt.tight_layout()
plt.show()
多图表组合展示
fig, axes = plt.subplots(1, 2, figsize=(16, 5))
# 子图1:评分TOP10电影
top_movies = pd.read_sql("""
SELECT title, rating FROM movies
ORDER BY rating DESC LIMIT 10
""", conn)
sns.barplot(x='rating', y='title', data=top_movies, ax=axes[0])
axes[0].set_title('评分TOP10电影')
# 子图2:导演作品数量
directors_count = pd.read_sql("""
SELECT directors, COUNT(*) as count
FROM movies GROUP BY directors
ORDER BY count DESC LIMIT 10
""", conn)
directors_count['directors'] = directors_count['directors'].str[:10] + '...'
sns.barplot(x='count', y='directors', data=directors_count, ax=axes[1])
axes[1].set_title('高产导演TOP10')
plt.tight_layout()
plt.show()
常见问题
Q:如何处理爬虫数据中的缺失值?
A:可视化前需清洗数据:
# 删除评分缺失的电影
df.dropna(subset=['rating'], inplace=True)
# 填充年份缺失值为0(根据业务需求)
df['year'].fillna(0, inplace=True)
Q:MySQL插入数据时报错"Duplicate entry"?
A:检查表是否设置唯一约束(如标题),可在插入前查询是否存在:
def is_exists(title):
with conn.cursor() as cursor:
cursor.execute("SELECT id FROM movies WHERE title=%s", (title,))
return cursor.fetchone() is not None
Q:如何优化MongoDB查询性能?
A:为常用查询字段创建索引:
collection.create_index([('year', pymongo.ASCENDING)])
小结
本文通过完整案例演示了Python爬虫数据的全生命周期管理:
- 存储方案:MySQL适合结构化查询,MongoDB适合快速迭代开发
- 可视化技巧:Matplotlib基础绘图 + Seaborn高级统计图表
- 关键步骤:数据清洗 → 存储优化 → 图表选型 → 组合展示
建议读者从简单项目开始实践,例如先爬取本地天气数据存储到SQLite,再用折线图展示温度变化。掌握这些技能后,你将能轻松应对电商价格监控、社交媒体舆情分析等真实业务场景。
💡 推荐阅读
Python爬虫实战:爬取电商平台商品信息
想要获取电商平台的商品信息却无从下手?本文将通过实战案例,教你使用Python爬虫爬取电商平台商品数据,包括价格、销量等,助你分析市场!
Python爬虫反爬策略与应对方法
爬虫经常遇到反爬机制怎么办?本文将揭秘常见反爬策略,并教你如何使用Python应对,让你的爬虫更加稳定高效,轻松突破反爬限制!
剪映模板素材哪里找?优质资源推荐
想要找到优质的剪映模板素材?本文为你推荐几个可靠的资源网站,让你轻松获取丰富多样的模板素材,提升视频制作水平。
Android通知历史记录:轻松回顾错过的消息
错过重要消息?Android通知历史记录来帮你!本文教你如何查看和管理通知历史记录,不再错过任何重要信息。
批量打印入门:如何快速设置打印任务?
批量打印能大幅提升效率,但设置起来却让不少人头疼。本文将带你从零开始,学习如何快速设置打印任务,掌握基础技巧,让打印变得轻松又高效。
WPS演示图表制作技巧:数据可视化轻松搞定
数据太多难以呈现?本文将教你如何使用WPS演示制作图表,将复杂数据转化为直观图表,让观众一眼看懂数据背后的故事,提升演示说服力。
如何通过外链(Backlinks)提升网站权重?
外链是SEO中重要的排名因素之一,高质量的外链能显著提升网站权重。本文将教你如何获取高质量外链,避免低质量外链的坑,让你的网站排名更上一层楼。
OBS 录屏软件安装全攻略:零基础快速上手
还在为 OBS 安装问题发愁?本文将详细介绍 OBS 录屏软件在 Windows、Mac 系统上的安装步骤,以及安装过程中的常见问题及解决方法,让你轻松开启录屏之旅。
Excel打印高级技巧:如何打印网格线和批注?
打印Excel表格时,如何打印网格线和批注?本文教你使用Excel的高级打印设置,轻松实现网格线和批注的打印。
AE预设应用指南:快速打造专业级视频
想要快速打造专业级视频?AE预设应用来帮你!本文将详细介绍AE预设的使用方法,让你轻松应用各种预设效果,提升视频质量。
手机夜景拍摄全攻略:轻松拍出璀璨夜色
夜景拍摄是手机摄影的难点,但掌握技巧后也能拍出惊艳作品。本文将分享手机夜景拍摄的参数设置、构图技巧及实用小工具,助你轻松捕捉城市夜晚的璀璨与静谧。
iOS系统设置:如何快速关闭后台应用刷新?
后台应用刷新会悄悄消耗电量和流量,其实iOS系统设置里就能轻松关闭。本文将教你一步步操作,还能了解关闭后的影响,让你的iPhone更省电!
PowerPoint动画优化:如何提升动画的流畅度和自然度?
动画效果不够流畅?不够自然?本文教你如何优化动画设置,让动画更加逼真和吸引人。
如何用AI工具快速生成短视频封面和标题?
AI工具能大幅提升短视频封面和标题的设计效率。本文介绍几款实用AI工具,助你快速生成高质量封面和标题。
Excel错误值处理的7个实用技巧
系统讲解Excel错误值的处理方案,涵盖#N/A、#DIV/0!、#VALUE!等常见错误的解决方法,提升公式稳定性。
OBS场景与来源优化:提升录屏直播质量
录屏直播质量不佳?可能是场景与来源设置有问题。本文将教你如何优化OBS的场景与来源设置,包括分辨率、帧率、音频质量等,让你的录屏直播更加清晰、流畅。
Android系统设置进阶:提升手机性能的秘诀
想要让Android手机运行更流畅?掌握这些系统设置进阶技巧,轻松提升手机性能,告别卡顿。
隐私浏览模式真的完全安全吗?
隐私浏览模式看似安全,但真的完全无懈可击吗?本文将探讨隐私浏览模式的局限性,如无法阻止ISP追踪、无法保护公共WiFi安全等,帮助你更全面地了解隐私浏览。
数码配件保养与维护:延长使用寿命的小技巧
数码配件也需要保养!本文分享一些实用的保养与维护小技巧,帮助你延长数码配件的使用寿命,节省更换成本!
Photoshop入门教程:PS基础操作完全指南
本教程介绍Adobe Photoshop的核心概念和基础操作,包括界面认识、图层管理、选区工具、常用调色功能,帮助零基础用户快速入门PS。