跳至内容

Amazon S3 二十周年:从简单存储到 AI 时代的数据基石

2 分钟阅读
内容级别:基础
0

2026年3月14日,Amazon S3 迎来了上线二十周年。AWS 官方博客发布了一篇回顾文章,梳理了 S3 从一个简单对象存储服务成长为全球最大规模云存储平台的历程,并展望了其作为 AI 时代数据基座的未来方向。本文对该博客进行了中文汇总整理,帮助中文读者快速了解 S3 二十年的关键里程碑、技术演进和最新能力。


来源: AWS News Blog,作者 Sébastien Stormacq,2026年3月13日发布 原文链接: Twenty years of Amazon S3 and building what's next


一、起源:低调的开端

2006年3月14日,Amazon S3(Simple Storage Service)以一段简短的公告悄然上线。当时连 AWS 首席布道师 Jeff Barr 的博客文章也只有寥寥数段,没有代码示例,没有演示。然而,这个看似不起眼的发布,最终重塑了整个云计算行业。

S3 的核心理念是提供最基础的构建模块——PUT 存储对象、GET 检索对象——将底层的"无差别繁重工作"交给平台处理,让开发者专注于更高层次的业务创新。

二、二十年不变的五大基本原则

自诞生之日起,S3 始终坚守五项核心设计原则:

  1. 安全性:数据默认受到保护
  2. 持久性:设计目标为 11 个 9(99.999999999%),以"零丢失"为运营标准
  3. 可用性:每一层架构都内建高可用,假设故障随时存在并主动应对
  4. 性能:存储任意规模数据而不产生性能退化
  5. 弹性:系统随数据增减自动伸缩,无需人工干预

三、规模增长:从 1PB 到数百 EB

指标2006年发布时2026年今天
总存储容量约 1 PB数百 EB(百亿亿字节级)
存储对象数设计目标数百亿超过 500 万亿个对象
全球请求量每秒超过 2 亿次请求
单对象最大尺寸5 GB50 TB(增长 10,000 倍)
基础设施约 400 个存储节点、15 个机架、3 个数据中心39 个 AWS 区域、123 个可用区
存储单价每 GB 15 美分约每 GB 2 美分(降幅约 85%

值得一提的是,仅 S3 Intelligent-Tiering 一项功能,就已为客户累计节省超过 60 亿美元的存储成本。

四、工程创新:规模背后的技术支撑

  • 微服务审计体系:持续检查整个存储集群中的每一个字节,一旦检测到数据退化迹象,立即触发自动修复。
  • 形式化验证与自动推理:在生产环境中使用数学证明来验证代码正确性,确保一致性不会因代码变更而退化。
  • Rust 重写:过去 8 年间,S3 逐步将请求路径中的性能关键代码用 Rust 重写,利用其类型系统和内存安全保证在编译期消除整类缺陷。
  • "规模即优势"设计哲学:系统越大,工作负载越去相关化,可靠性反而越高。

五、面向未来:从存储服务到 AI 数据基座

S3 的愿景已超越传统存储服务,正在成为所有数据和 AI 工作负载的通用基础层。核心理念是:数据只需存储一次,即可就地处理,无需在专用系统之间搬移数据

近年来的重要发布包括:

  • S3 Tables:全托管 Apache Iceberg 表,自动维护以优化查询效率并降低存储成本。
  • S3 Vectors:原生向量存储,支持语义搜索和 RAG(检索增强生成),单索引可容纳多达 20 亿向量,查询延迟低于 100 毫秒。上线仅 5 个月(2025年7月至12月),用户已创建超过 25 万个索引、写入超过 400 亿向量、执行超过 10 亿次查询。
  • S3 Metadata:集中式元数据管理,实现即时数据发现,无需递归列举大型存储桶即可完成数据编目。

六、最令人瞩目的承诺

2006 年编写的 S3 代码,今天依然可以正常运行,无需任何修改。

二十年间,底层基础设施经历了多代硬盘和存储系统的迁移,处理请求的代码已被完全重写,但 API 保持了完全的向后兼容。这是 AWS 对"服务始终可用"这一承诺的最佳诠释。


原文信息来源于 AWS News Blog。*


AWS
专家

已​发布 2 个月前105 查看次数