<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>大数据 on 老张开工了</title>
    <link>/%E5%A4%A7%E6%95%B0%E6%8D%AE/</link>
    <description>Recent content in 大数据 on 老张开工了</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Wed, 22 Jan 2025 00:00:00 +0000</lastBuildDate>
    <atom:link href="/%E5%A4%A7%E6%95%B0%E6%8D%AE/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>大数据入门</title>
      <link>/posts/2025/01/big-data-intro/</link>
      <pubDate>Wed, 22 Jan 2025 00:00:00 +0000</pubDate>
      <guid>/posts/2025/01/big-data-intro/</guid>
      <description>什么时候需要大数据？ 在前面的文章中，我们一直用 Pandas 处理数据。对于百万级的数据集，Pandas 表现良好。但当数据量达到千万、亿级时，你会遇到以下问题：&#xA;内存不足：Pandas 需要把所有数据加载到内存中。10GB 的 CSV 文件需要至少 10GB 内存来进行处理。 计算时间过长：groupby 或 join 操作可能需要几分钟甚至几小时。 单机资源瓶颈：一台机器的 CPU 核心数有限，无法并行处理大量数据。 这就是大数据技术介入的时刻。&#xA;大数据 4V 特征 特征 英文 说明 体量 Volume 数据量巨大，TB 甚至 PB 级别 速度 Velocity 数据生产和处理速度快，实时流数据 多样 Variety 数据类型多样：结构化、半结构化、非结构化 真实 Veracity 数据质量和真实性不一致，需要验证 分布式计算基础 大数据的核心理念是分布式计算：把大任务拆成小块，在多台机器上并行执行。&#xA;MapReduce 思想 MapReduce 是分布式计算的经典范式，包含两个阶段：&#xA;Map（映射）：把数据分片，每个分片独立处理，产生键值对 Reduce（归约）：将相同键的结果聚合起来 输入: [A, B, C, D, E, F] | | | | | | Map Map Map Map Map Map (并行处理) | | | | | | \ / \ / \ / Reduce Reduce Reduce (聚合结果) | | | [结果1] [结果2] [结果3] Apache Spark 概述 Spark 是目前最流行的大数据处理框架。它比传统的 Hadoop MapReduce 快 10-100 倍，因为它利用内存计算，避免了频繁的磁盘读写。</description>
    </item>
  </channel>
</rss>
