当前位置：首页 > news >正文

python之爬虫入门实例

news 2025/11/4 17:33:10

链家二手房数据抓取与Excel存储

一、开发环境准备

1.1 必要组件安装

# 安装核心库
pip install requests beautifulsoup4 openpyxl pandas

# 各库作用说明：
- requests：网络请求库（版本≥2.25.1）
- beautifulsoup4：HTML解析库（版本≥4.11.2）
- openpyxl：Excel文件操作库（版本≥3.1.2）
- pandas：数据分析库（版本≥2.0.3）

1.2 开发环境验证

import requests
from bs4 import BeautifulSoup
import pandas as pd

print("所有库加载成功！")

二、爬虫流程分析

2.1 技术路线图

2.2 目标页面结构

https://cq.lianjia.com/ershoufang/
├── div.leftContent
│   └── ul.sellListContent
│       └── li[data-houseid]  # 单个房源
│           ├── div.title > a  # 标题
│           ├── div.flood > div  # 地址
│           ├── div.priceInfo > div.totalPrice  # 总价
│           └── div.followInfo  # 关注量

三、核心代码实现

3.1 完整代码（带详细注释）

"""
链家二手房数据采集器
版本：1.2
"""

import requests
from bs4 import BeautifulSoup
import pandas as pd
from time import sleep

# 配置请求头（模拟浏览器访问）
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36',
    'Accept-Language': 'zh-CN,zh;q=0.9'
}

def get_house_data(max_page=5):
    """
    获取链家二手房数据
    参数：
        max_page: 最大爬取页数（默认5页）
    返回：
        pandas.DataFrame格式的清洗后数据
    """
    all_data = []
    
    for page in range(1, max_page+1):
        # 构造分页URL
        url = f"https://cq.lianjia.com/ershoufang/pg{page}/"
        
        try:
            # 发送HTTP请求（加入延迟防止封IP）
            response = requests.get(url, headers=headers, timeout=10)
            response.raise_for_status()  # 检测HTTP状态码
            sleep(1.5)  # 请求间隔
            
            # 解析HTML文档
            soup = BeautifulSoup(response.text, 'lxml')
            
            # 定位房源列表
            house_list = soup.select('ul.sellListContent > li[data-houseid]')
            
            for house in house_list:
                # 数据提取（带异常处理）
                try:
                    title = house.select_one('div.title a').text.strip()
                    address = house.select_one('div.flood > div').text.strip()
                    total_price = house.select_one('div.totalPrice').text.strip()
                    unit_price = house.select_one('div.unitPrice').text.strip()
                    follow = house.select_one('div.followInfo').text.split('/')[0].strip()
                    
                    # 数据清洗
                    cleaned_data = {
                        '标题': title,
                        '地址': address.replace(' ', ''),
                        '总价(万)': float(total_price.replace('万', '')),
                        '单价(元/㎡)': int(unit_price.replace('元/㎡', '').replace(',', '')),
                        '关注量': int(follow.replace('人关注', ''))
                    }
                    all_data.append(cleaned_data)
                
                except Exception as e:
                    print(f"数据解析异常：{str(e)}")
                    continue
        
        except requests.exceptions.RequestException as e:
            print(f"网络请求失败：{str(e)}")
            continue
    
    return pd.DataFrame(all_data)

def save_to_excel(df, filename='house_data.xlsx'):
    """
    将数据保存为Excel文件
    参数：
        df: pandas.DataFrame数据框
        filename: 输出文件名
    """
    # 配置Excel写入参数
    writer = pd.ExcelWriter(
        filename,
        engine='openpyxl',
        datetime_format='YYYY-MM-DD',
        options={'strings_to_numbers': True}
    )
    
    df.to_excel(
        writer,
        index=False,
        sheet_name='链家数据',
        float_format="%.2f",
        freeze_panes=(1,0)
    )
    
    # 保存并优化列宽
    writer.book.save(filename)
    print(f"数据已保存至 {filename}")

if __name__ == '__main__':
    # 执行数据采集
    house_df = get_house_data(max_page=3)
    
    # 数据保存
    if not house_df.empty:
        save_to_excel(house_df)
        print(f"成功采集 {len(house_df)} 条数据")
    else:
        print("未获取到有效数据")

四、关键命令详解

4.1 核心方法说明

4.1.1 pandas.to_excel参数解析

df.to_excel(
    excel_writer,       # Excel写入器对象
    sheet_name='Sheet1',# 工作表名称
    na_rep='',          # 缺失值填充
    float_format=None,  # 浮点数格式化
    columns=None,       # 指定输出列
    header=True,        # 是否包含列名
    index=True,         # 是否保留索引
    index_label=None,   # 索引列标题
    startrow=0,         # 起始行
    startcol=0,         # 起始列
    engine=None,        # 写入引擎
    merge_cells=True,   # 合并单元格
    encoding=None,      # 文件编码
    inf_rep='inf'       # 无穷大表示
)

4.2 防反爬策略

# 1. 请求头伪装
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64)',
    'Accept-Encoding': 'gzip, deflate, br',
    'Referer': 'https://cq.lianjia.com/'
}

# 2. IP代理池示例
proxies = {
    'http': 'http://10.10.1.10:3128',
    'https': 'http://10.10.1.10:1080',
}

# 3. 请求速率控制
import random
sleep(random.uniform(1, 3))

五、进阶优化方案

5.1 数据存储优化

# 多Sheet存储
with pd.ExcelWriter('output.xlsx') as writer:
    df1.to_excel(writer, sheet_name='重庆')
    df2.to_excel(writer, sheet_name='北京')

# 追加模式写入
def append_to_excel(df, filename):
    from openpyxl import load_workbook
    book = load_workbook(filename)
    writer = pd.ExcelWriter(filename, engine='openpyxl')
    writer.book = book
    df.to_excel(writer, startrow=writer.sheets['Sheet1'].max_row, index=False)
    writer.save()

5.2 异常监控体系

# 错误日志记录
import logging
logging.basicConfig(
    filename='spider.log',
    level=logging.ERROR,
    format='%(asctime)s - %(levelname)s - %(message)s'
)

try:
    # 爬虫代码
except Exception as e:
    logging.error(f"严重错误：{str(e)}", exc_info=True)

六、注意事项

法律合规
严格遵守《网络安全法》和网站Robots协议，控制采集频率
数据清洗
建议增加字段校验：

def validate_price(price):
    return 10 < price < 2000  # 重庆房价合理范围校验

性能调优
- 启用多线程采集（需控制并发数）
- 使用lxml解析器替代html.parser
- 禁用BeautifulSoup的格式化功能
存储扩展

存储方式	优点	缺点
Excel	查看方便	大数据性能差
CSV	通用格式	无多Sheet支持
SQLite	轻量级数据库	需要SQL知识
MySQL	适合大规模存储	需要部署数据库

# 快速使用指南

1. 安装依赖库：
```bash
pip install -r requirements.txt

运行爬虫：

python lianjia_spider.py

输出文件：

house_data.xlsx：清洗后的完整数据
spider.log：错误日志记录


通过本方案可实现日均10万级数据的稳定采集，建议根据实际需求调整采集频率和存储方案。请务必遵守相关法律法规，合理使用爬虫技术。

查看全文

http://www.dtcms.com/a/51940.html

java后端开发day27--常用API（二）正则表达式爬虫

【Day9】make/makeFile如何让项目构建自动化起飞

神经网络|(十三)|SOM神经网络

CSS 中等比例缩放的演变：从传统技巧到 aspect-ratio 属性

SpringBoot-模拟SSE对话交互

全局异常处理器为什么不能处理过滤器异常，有那些解决方案

vxe-table开启表尾和el-collapse-transition不兼容，动画卡顿

【Qt QML】Loader动态加载组件（续）

《安富莱嵌入式周报》第351期：DIY半导体制造，工业设备抗干扰提升方法，NASA软件开发规范，小型LCD在线UI编辑器，开源USB PD电源，开源锂电池管理

Web后端开发-总结

多线程-JUC源码

利用opencv_python(pdf2image、poppler）将pdf每页转为图片

2025年夸克网盘自动签到程序,验证通过!

android App主题颜色动态更换

IO进程线程3

【AD】5-3 PCB板框的内缩与外扩

OpenBMC：BmcWeb app获取socket

嵌入式 ARM Linux 系统构成(1)：Bootloader层

oracle通过dmp导入数据

PHP之运算符

python-串口助手（OV7670图传）

文献分享: ConstBERT固定数目向量编码文档

java 查找连个集合的交集部分数据

生命周期总结（uni-app、vue2、vue3生命周期讲解）

Linux总结

进程间通信

【单片机】嵌入式系统设计流程

【仿muduo库one thread one loop式并发服务器实现】

美股回测：历史高频分钟数据的分享下载与策略解析20250305

配置hosts