<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>EDA on 老张开工了</title>
    <link>/eda/</link>
    <description>Recent content in EDA on 老张开工了</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Wed, 08 Jan 2025 00:00:00 +0000</lastBuildDate>
    <atom:link href="/eda/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>探索性数据分析（EDA）</title>
      <link>/posts/2025/01/exploratory-data-analysis/</link>
      <pubDate>Wed, 08 Jan 2025 00:00:00 +0000</pubDate>
      <guid>/posts/2025/01/exploratory-data-analysis/</guid>
      <description>拿到一份干净的数据后，你的第一反应是什么？很多人会立刻跑模型、调参数，但这是本末倒置。在建模之前，你需要先回答两个问题：这些数据长什么样？里面有什么规律？&#xA;探索性数据分析（EDA）就是回答这两个问题的过程。它不是一次性的步骤，而是一个反复提问、画图、计算、再提问的循环。好的 EDA 能帮你发现数据质量问题、验证假设、指导特征工程，甚至直接决定选什么模型。&#xA;EDA 的核心方法论 EDA 没有固定脚本，但有一个可循的工作流：&#xA;概览：数据有多大？每列是什么类型？有没有明显的缺失和异常？ 单变量分析：每个变量各自的分布如何？ 双变量分析：两个变量之间有什么关系？ 多变量分析：多个变量综合起来能发现什么？ 总结与假设：形成分析假设，进入建模阶段。 我们以 Kaggle 的 Titanic 数据集为例，一步步走完 EDA 流程。&#xA;环境与数据加载 import numpy as np import pandas as pd import matplotlib.pyplot as plt import seaborn as sns import warnings warnings.filterwarnings(&amp;#39;ignore&amp;#39;) # 设置中文字体 plt.rcParams[&amp;#39;font.sans-serif&amp;#39;] = [&amp;#39;SimHei&amp;#39;] plt.rcParams[&amp;#39;axes.unicode_minus&amp;#39;] = False sns.set_theme(style=&amp;#39;whitegrid&amp;#39;, palette=&amp;#39;muted&amp;#39;) 我们直接加载 Titanic 数据集：&#xA;# 从 seaborn 加载 df = sns.load_dataset(&amp;#39;titanic&amp;#39;) print(&amp;#39;数据集大小:&amp;#39;, df.shape) print(&amp;#39;\n前 5 行:&amp;#39;) print(df.head()) 第一步：快速概览 # 基本信息 print(df.info()) # 数值统计 print(df.</description>
    </item>
  </channel>
</rss>
