3 minutes
开发环境搭建
在开始数据分析之前,我们需要搭建一个稳定的开发环境。一个配置得当的环境能让你事半功倍。本文将手把手带你从零开始配置 Python 数据分析环境。
选择 Python 版本管理工具
Python 有多个版本,不同项目可能依赖不同版本。为了避免版本冲突,我们推荐使用版本管理工具。
方案一:Miniconda(推荐初学者)
Miniconda 是 Anaconda 的精简版,它包含了 conda 包管理器和 Python,但不预装大量科学计算包。你只需要安装需要的包,避免了臃肿的环境。
下载和安装 Miniconda:
访问 Miniconda 官网,选择 Python 3.10 或更高版本的 Windows 安装包。运行安装程序,建议勾选"Add Miniconda to my PATH environment variable"(或安装后手动配置)。
安装完成后,打开终端(PowerShell 或 cmd),验证安装:
conda --version
你应该能看到类似 conda 24.x.x 的输出。
方案二:pyenv(进阶用户)
如果你更喜欢原生 Python 工具链,pyenv 是另一个不错的选择。在 Windows 上可以使用 pyenv-win:
# 使用 pip 安装 pyenv-win
pip install pyenv-win --target $env:USERPROFILE\.pyenv
然后配置环境变量,就可以使用 pyenv install 3.11.0 安装指定版本的 Python 了。
创建虚拟环境
虚拟环境是 Python 开发的最佳实践。它让你为每个项目隔离依赖包,避免不同项目之间的包版本冲突。
使用 conda 创建虚拟环境
# 创建名为 data-analysis 的环境,指定 Python 3.11
conda create -n data-analysis python=3.11
# 激活环境
conda activate data-analysis
激活后,终端提示符前面会显示 (data-analysis),表示你已经在虚拟环境中。
使用 venv 创建虚拟环境
如果你选择原生 Python,可以使用内置的 venv 模块:
# 创建虚拟环境
python -m venv data-analysis-env
# 激活环境(Windows PowerShell)
.\data-analysis-env\Scripts\Activate.ps1
# 激活环境(Windows cmd)
.\data-analysis-env\Scripts\activate.bat
安装 Jupyter
Jupyter Notebook/Lab 是数据分析领域最流行的交互式开发环境。它让你能将代码、文本、可视化结果整合在一个文档中。
安装 JupyterLab
# 在激活的虚拟环境中安装
pip install jupyterlab notebook
启动 JupyterLab
jupyter lab
执行后,浏览器会自动打开 http://localhost:8888/lab。JupyterLab 的界面分为三个主要区域:
- 左侧文件浏览器:浏览和打开文件
- 中间工作区:编辑和运行 Notebook
- 右侧面板:查看变量、Git 状态等
Jupyter Notebook 基础操作
- 新建 Notebook:点击 File > New > Notebook,选择 Python 内核
- 单元格类型:Code(代码)和 Markdown(文本)
- 运行单元格:按
Shift + Enter运行当前单元格并移动到下一个 - 快捷键:
A:在上方插入单元格B:在下方插入单元格DD:删除单元格M:切换为 Markdown 单元格Y:切换为代码单元格
配置 VS Code
Visual Studio Code 是数据分析的绝佳编辑器,配合相关扩展能提供接近 IDE 的开发体验。
安装 VS Code
从 code.visualstudio.com 下载安装包并安装。
必装扩展
- Python (Microsoft):提供语法高亮、IntelliSense、代码补全、调试功能
- Jupyter (Microsoft):在 VS Code 中直接编辑和运行 Jupyter Notebook
- Pylance:更强大的类型检查和代码补全
- Python Docstring Generator:自动生成文档注释
VS Code 设置
在 settings.json 中添加以下配置,指定默认的 Python 解释器:
{
"python.defaultInterpreterPath": "C:\\Users\\你的用户名\\miniconda3\\envs\\data-analysis\\python.exe",
"python.terminal.activateEnvironment": true,
"jupyter.kernels.filter": ["python"],
"editor.formatOnSave": true,
"editor.rulers": [88]
}
在 VS Code 中运行 Python 脚本
创建一个 .py 文件,右键选择 Run Python File in Terminal,或者在代码中按 Ctrl + F5 运行。
安装数据科学必备包
现在我们来安装数据分析最核心的 Python 包。确保你的虚拟环境已经激活。
使用 pip 安装
# 基础科学计算
pip install numpy==1.26.0 scipy==1.11.3
# 数据处理
pip install pandas==2.1.1
# 数据可视化
pip install matplotlib==3.8.0 seaborn==0.13.0
# 机器学习
pip install scikit-learn==1.3.1
# Jupyter 相关
pip install jupyter jupyterlab
如果你使用 conda,也可以直接用 conda 安装:
conda install numpy scipy pandas matplotlib seaborn scikit-learn jupyter jupyterlab
使用 requirements.txt
更好的做法是创建一个 requirements.txt 文件,记录所有依赖:
numpy==1.26.0
scipy==1.11.3
pandas==2.1.1
matplotlib==3.8.0
seaborn==0.13.0
scikit-learn==1.3.1
jupyter==1.0.0
jupyterlab==4.0.8
然后执行:
pip install -r requirements.txt
验证安装
创建一个简单的验证脚本来确认所有包都正确安装:
# verify_setup.py
import sys
import numpy as np
import pandas as pd
import matplotlib as mpl
import seaborn as sns
import sklearn
packages = {
"Python": sys.version,
"NumPy": np.__version__,
"Pandas": pd.__version__,
"Matplotlib": mpl.__version__,
"Seaborn": sns.__version__,
"Scikit-learn": sklearn.__version__
}
print("=" * 40)
print("环境验证成功!所有包已正确安装。")
print("=" * 40)
for name, version in packages.items():
print(f"{name:15s}: {version}")
Hello World Notebook
现在让我们创建一个简单的 Notebook 来验证整个环境。
在 JupyterLab 中创建一个新的 Notebook,命名为 hello_data_analysis.ipynb,然后输入以下代码并运行:
# 第一个数据分析 Notebook
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
# 生成示例数据
np.random.seed(42)
data = {
"月份": ["一月", "二月", "三月", "四月", "五月", "六月"],
"销售额": np.random.randint(100, 500, 6),
"成本": np.random.randint(50, 300, 6)
}
df = pd.DataFrame(data)
df["利润"] = df["销售额"] - df["成本"]
print("示例数据表:")
print(df)
print()
# 简单统计
print("描述性统计:")
print(df[["销售额", "成本", "利润"]].describe())
添加一个绘图单元格:
# 绘制折线图
plt.figure(figsize=(10, 5))
plt.plot(df["月份"], df["销售额"], marker="o", label="销售额", linewidth=2)
plt.plot(df["月份"], df["成本"], marker="s", label="成本", linewidth=2)
plt.plot(df["月份"], df["利润"], marker="^", label="利润", linewidth=2)
plt.title("月度经营数据", fontsize=14, pad=15)
plt.xlabel("月份")
plt.ylabel("金额")
plt.legend()
plt.grid(True, alpha=0.3)
plt.show()
如果一切顺利,你应该能看到一个包含三条折线的图表。恭喜,你的数据分析环境已经搭建完成!
Git 版本控制
作为良好的开发习惯,建议使用 Git 管理你的分析项目:
# 初始化 Git 仓库
git init
# 创建 .gitignore 文件(排除不需要跟踪的文件)
echo __pycache__/ > .gitignore
echo .ipynb_checkpoints/ >> .gitignore
echo *.pyc >> .gitignore
echo data-analysis-env/ >> .gitignore
echo .env >> .gitignore
# 首次提交
git add .
git commit -m "初始化数据分析项目"
常见问题排查
pip 安装速度慢
使用国内镜像源加速:
pip install numpy pandas -i https://pypi.tuna.tsinghua.edu.cn/simple
永久配置镜像源:
pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple
Jupyter 内核找不到虚拟环境
如果你的虚拟环境在 Jupyter 中不可见,需要手动添加内核:
# 确保虚拟环境已激活
pip install ipykernel
python -m ipykernel install --user --name data-analysis --display-name "Python (data-analysis)"
SSL 证书错误
某些企业网络环境下可能出现 SSL 错误,可以临时使用非验证方式:
pip install --trusted-host pypi.org --trusted-host pypi.python.org --trusted-host files.pythonhosted.org numpy
下一步
环境搭建完成后,你就可以开始学习 Python 基础知识了。下一篇文章我们将快速梳理数据分析中最常用的 Python 语法和技巧,为后续深入学习打好基础。