Python爬虫数据存储与可视化分析
爬取到的数据如何存储与可视化分析?本文将教你使用Python将爬虫数据存储到数据库,并通过图表展示分析结果,让你的数据更加直观易懂!
引言 / 什么是爬虫数据存储与可视化分析
在当今数据驱动的时代,网络爬虫已成为获取公开数据的重要工具。但仅获取数据远不够——如何高效存储并从中提取价值才是关键。例如,电商网站的价格监控需要长期存储商品数据,并通过折线图观察价格波动;新闻网站的内容分析需要存储文章并生成词云图展示热点关键词。
本文将系统讲解Python爬虫数据的完整处理流程:从数据存储(MySQL/MongoDB)到可视化分析(Matplotlib/Seaborn),并通过真实案例演示如何将爬取的豆瓣电影数据存储到数据库,并用图表展示评分分布与年份趋势。
准备工作
环境配置:
- Python 3.6+
- 数据库:MySQL 8.0 或 MongoDB 5.0
- 库安装:
pip install pymysql pymongo matplotlib seaborn pandas requests
数据源准备:
- 示例使用豆瓣电影Top250页面(
https://movie.douban.com/top250) - 需处理分页逻辑与反爬机制(如设置
User-Agent和延迟)
- 示例使用豆瓣电影Top250页面(
核心数据存储方案
方案一:关系型数据库(MySQL)
适用场景:结构化数据、需要复杂查询(如按年份筛选电影)
import pymysql
from pymysql.cursors import DictCursor
# 创建数据库连接
conn = pymysql.connect(
host='localhost',
user='root',
password='your_password',
database='spider_db',
charset='utf8mb4',
cursorclass=DictCursor
)
# 创建表
with conn.cursor() as cursor:
cursor.execute("""
CREATE TABLE IF NOT EXISTS movies (
id INT AUTO_INCREMENT PRIMARY KEY,
title VARCHAR(100) NOT NULL,
rating FLOAT,
year INT,
directors VARCHAR(200),
quote TEXT
)
""")
conn.commit()
数据插入示例:
def save_to_mysql(movie_data):
with conn.cursor() as cursor:
sql = """
INSERT INTO movies (title, rating, year, directors, quote)
VALUES (%s, %s, %s, %s, %s)
"""
cursor.execute(sql, (
movie_data['title'],
movie_data['rating'],
movie_data['year'],
','.join(movie_data['directors']),
movie_data['quote']
))
conn.commit()
方案二:非关系型数据库(MongoDB)
适用场景:半结构化数据、快速开发(如存储包含嵌套字段的JSON数据)
from pymongo import MongoClient
# 连接MongoDB
client = MongoClient('mongodb://localhost:27017/')
db = client['spider_db']
collection = db['movies']
# 插入文档
def save_to_mongo(movie_data):
collection.insert_one({
'title': movie_data['title'],
'rating': movie_data['rating'],
'year': movie_data['year'],
'directors': movie_data['directors'],
'quote': movie_data['quote'],
'crawl_time': datetime.now()
})
对比表格:
| 特性 | MySQL | MongoDB |
|---|---|---|
| 数据模型 | 表格(行和列) | 文档(JSON格式) |
| 查询语言 | SQL | MongoDB查询语法 |
| 事务支持 | ACID兼容 | 4.0+支持多文档事务 |
| 最佳场景 | 金融交易、报表系统 | 日志分析、内容管理系统 |
数据可视化分析实战
基础图表绘制(Matplotlib)
场景:展示豆瓣电影评分分布
import matplotlib.pyplot as plt
import pandas as pd
# 从MySQL读取数据
def load_from_mysql():
with conn.cursor() as cursor:
cursor.execute("SELECT rating FROM movies")
ratings = [row['rating'] for row in cursor.fetchall()]
return ratings
ratings = load_from_mysql()
# 绘制直方图
plt.figure(figsize=(10, 6))
plt.hist(ratings, bins=10, edgecolor='black', alpha=0.7)
plt.title('豆瓣电影评分分布', fontsize=16)
plt.xlabel('评分', fontsize=12)
plt.ylabel('电影数量', fontsize=12)
plt.grid(axis='y', alpha=0.3)
plt.show()
高级可视化(Seaborn)
场景:分析电影年份与评分的关系
import seaborn as sns
# 从MongoDB读取数据并转换为DataFrame
def load_from_mongo():
docs = list(collection.find({}, {'year': 1, 'rating': 1}))
return pd.DataFrame(docs)
df = load_from_mongo()
# 绘制箱线图
plt.figure(figsize=(12, 6))
sns.boxplot(x='year', y='rating', data=df[df['year'] > 1990])
plt.title('1990年后电影评分年份分布', fontsize=16)
plt.xticks(rotation=45)
plt.tight_layout()
plt.show()
多图表组合展示
fig, axes = plt.subplots(1, 2, figsize=(16, 5))
# 子图1:评分TOP10电影
top_movies = pd.read_sql("""
SELECT title, rating FROM movies
ORDER BY rating DESC LIMIT 10
""", conn)
sns.barplot(x='rating', y='title', data=top_movies, ax=axes[0])
axes[0].set_title('评分TOP10电影')
# 子图2:导演作品数量
directors_count = pd.read_sql("""
SELECT directors, COUNT(*) as count
FROM movies GROUP BY directors
ORDER BY count DESC LIMIT 10
""", conn)
directors_count['directors'] = directors_count['directors'].str[:10] + '...'
sns.barplot(x='count', y='directors', data=directors_count, ax=axes[1])
axes[1].set_title('高产导演TOP10')
plt.tight_layout()
plt.show()
常见问题
Q:如何处理爬虫数据中的缺失值?
A:可视化前需清洗数据:
# 删除评分缺失的电影
df.dropna(subset=['rating'], inplace=True)
# 填充年份缺失值为0(根据业务需求)
df['year'].fillna(0, inplace=True)
Q:MySQL插入数据时报错"Duplicate entry"?
A:检查表是否设置唯一约束(如标题),可在插入前查询是否存在:
def is_exists(title):
with conn.cursor() as cursor:
cursor.execute("SELECT id FROM movies WHERE title=%s", (title,))
return cursor.fetchone() is not None
Q:如何优化MongoDB查询性能?
A:为常用查询字段创建索引:
collection.create_index([('year', pymongo.ASCENDING)])
小结
本文通过完整案例演示了Python爬虫数据的全生命周期管理:
- 存储方案:MySQL适合结构化查询,MongoDB适合快速迭代开发
- 可视化技巧:Matplotlib基础绘图 + Seaborn高级统计图表
- 关键步骤:数据清洗 → 存储优化 → 图表选型 → 组合展示
建议读者从简单项目开始实践,例如先爬取本地天气数据存储到SQLite,再用折线图展示温度变化。掌握这些技能后,你将能轻松应对电商价格监控、社交媒体舆情分析等真实业务场景。
💡 推荐阅读
Python爬虫实战:爬取电商平台商品信息
想要获取电商平台的商品信息却无从下手?本文将通过实战案例,教你使用Python爬虫爬取电商平台商品数据,包括价格、销量等,助你分析市场!
Python爬虫反爬策略与应对方法
爬虫经常遇到反爬机制怎么办?本文将揭秘常见反爬策略,并教你如何使用Python应对,让你的爬虫更加稳定高效,轻松突破反爬限制!
剪映模板素材哪里找?优质资源推荐
想要找到优质的剪映模板素材?本文为你推荐几个可靠的资源网站,让你轻松获取丰富多样的模板素材,提升视频制作水平。
手机进水后如何紧急处理?5步自救指南
手机意外落水别慌!掌握这5个紧急处理步骤,能大幅降低手机损坏风险,甚至可能让手机恢复如初。快来学习正确的自救方法吧!
Android通知历史记录:轻松回顾错过的消息
错过重要消息?Android通知历史记录来帮你!本文教你如何查看和管理通知历史记录,不再错过任何重要信息。
手机充电显示异常?解读与修复指南
手机充电时显示异常?本文解读常见显示问题,如不显示充电、电量跳变等,并提供修复方法,让你的手机充电显示恢复正常。
WPS演示图表制作技巧:数据可视化轻松搞定
数据太多难以呈现?本文将教你如何使用WPS演示制作图表,将复杂数据转化为直观图表,让观众一眼看懂数据背后的故事,提升演示说服力。
手机摄影专业模式全解析:轻松拍出大片感
手机摄影专业模式功能强大,但很多人不知如何使用。本文将详细介绍专业模式各项参数,从基础到进阶,让你快速上手,轻松拍出具有大片感的照片,提升摄影水平。
电脑开机无反应?5步排查法轻松解决
电脑按下电源键却毫无反应?别慌!本文教你5步排查法,从电源、主板到内存,逐步定位问题根源,轻松解决开机无反应的难题。
批量打印入门:如何快速设置打印任务?
批量打印能大幅提升效率,但设置起来却让不少人头疼。本文将带你从零开始,学习如何快速设置打印任务,掌握基础技巧,让打印变得轻松又高效。
手机夜景拍摄全攻略:轻松拍出璀璨夜色
夜景拍摄是手机摄影的难点,但掌握技巧后也能拍出惊艳作品。本文将分享手机夜景拍摄的参数设置、构图技巧及实用小工具,助你轻松捕捉城市夜晚的璀璨与静谧。
剪映转场效果:如何让视频过渡更自然?
剪映转场效果大揭秘!本文将教你如何为视频添加转场效果,并调整转场的时长、方向等参数,让你的视频过渡更加自然流畅。
OBS 录屏软件安装全攻略:零基础快速上手
还在为 OBS 安装问题发愁?本文将详细介绍 OBS 录屏软件在 Windows、Mac 系统上的安装步骤,以及安装过程中的常见问题及解决方法,让你轻松开启录屏之旅。
Excel打印高级技巧:如何打印网格线和批注?
打印Excel表格时,如何打印网格线和批注?本文教你使用Excel的高级打印设置,轻松实现网格线和批注的打印。
Excel动态图表制作指南:用控件实现数据联动
通过表单控件与动态公式结合,教你创建可交互的销售分析仪表盘,让数据随选择自动更新变化。
PowerPoint动画优化:如何提升动画的流畅度和自然度?
动画效果不够流畅?不够自然?本文教你如何优化动画设置,让动画更加逼真和吸引人。
OneNote与Outlook联动:任务管理新玩法
OneNote不仅能记笔记,还能与Outlook联动管理任务!本文教你如何将笔记转化为任务,并设置提醒,让工作学习更有条理。
如何通过外链(Backlinks)提升网站权重?
外链是SEO中重要的排名因素之一,高质量的外链能显著提升网站权重。本文将教你如何获取高质量外链,避免低质量外链的坑,让你的网站排名更上一层楼。
如何用AI工具快速生成短视频封面和标题?
AI工具能大幅提升短视频封面和标题的设计效率。本文介绍几款实用AI工具,助你快速生成高质量封面和标题。
Android系统设置进阶:提升手机性能的秘诀
想要让Android手机运行更流畅?掌握这些系统设置进阶技巧,轻松提升手机性能,告别卡顿。