淘宝为什么能抗住90秒100亿？软件测试工程师必看！

科技 2024-11-16 10:01 上海

点击蓝字，立即关注

概述

本文以淘宝作为例子，介绍从一百个并发到千万级并发情况下服务端的架构的演进过程，同时列举出每个演进阶段会遇到的相关技术，让大家对架构的演进有一个整体的认知，文章最后汇总了一些架构设计的原则。

基本概念在介绍架构之前，为了避免部分读者对架构设计中的一些概念不了解，下面对几个最基础的概念进行介绍。

1）什么是分布式？

系统中的多个模块在不同服务器上部署，即可称为分布式系统，如Tomcat和数据库分别部署在不同的服务器上，或两个相同功能的Tomcat分别部署在不同服务器上。

2）什么是高可用？

系统中部分节点失效时，其他节点能够接替它继续提供服务，则可认为系统具有高可用性。

3）什么是集群？

一个特定领域的软件部署在多台服务器上并作为一个整体提供一类服务，这个整体称为集群。如Zookeeper中的Master和Slave分别部署在多台服务器上，共同组成一个整体提供集中配置服务。

在常见的集群中，客户端往往能够连接任意一个节点获得服务，并且当集群中一个节点掉线时，其他节点往往能够自动地接替它继续提供服务，这时候说明集群具有高可用性。

4）什么是负载均衡？

请求发送到系统时，通过某些方式把请求均匀分发到多个节点上，使系统中每个节点能够均匀地处理请求负载，则可认为系统是负载均衡的。

5）什么是正向代理和反向代理？

系统内部要访问外部网络时，统一通过一个代理服务器把请求转发出去，在外部网络看来就是代理服务器发起的访问，此时代理服务器实现的是正向代理；

当外部请求进入系统时，代理服务器把该请求转发到系统中的某台服务器上，对外部请求来说，与之交互的只有代理服务器，此时代理服务器实现的是反向代理。

简单来说，正向代理是代理服务器代替系统内部来访问外部网络的过程，反向代理是外部请求访问系统时通过代理服务器转发到内部服务器的过程。

纯真年代：单机架构

以淘宝作为例子：在网站最初时，应用数量与用户数都较少，可以把Tomcat和数据库部署在同一台服务器上。浏览器往www.taobao.com发起请求时，首先经过DNS服务器（域名系统）把域名转换为实际IP地址10.102.4.1，浏览器转而访问该IP对应的Tomcat。

架构瓶颈

随着用户数的增长，Tomcat和数据库之间竞争资源，单机性能不足以支撑业务。

第一次演进

Tomcat与数据库分开部署

Tomcat和数据库分别独占服务器资源，显著提高两者各自性能。

架构瓶颈

随着用户数的增长，并发读写数据库成为瓶颈。

第二次演进

引入本地缓存和分布式缓存

在Tomcat同服务器上或同JVM中增加本地缓存，并在外部增加分布式缓存，缓存热门商品信息或热门商品的html页面等。

通过缓存能把绝大多数请求在读写数据库前拦截掉，大大降低数据库压力。其中涉及的技术包括：使用memcached作为本地缓存，使用Redis作为分布式缓存，还会涉及缓存一致性、缓存穿透/击穿、缓存雪崩、热点数据集中失效等问题。

架构瓶颈

缓存扛住了大部分的访问请求，随着用户数的增长，并发压力主要落在单机的Tomcat上，响应逐渐变慢。

第三次演进

引入反向代理实现负载均衡

在多台服务器上分别部署Tomcat，使用反向代理软件（Nginx）把请求均匀分发到每个Tomcat中。

此处假设Tomcat最多支持100个并发，Nginx最多支持50000个并发，那么理论上Nginx把请求分发到500个Tomcat上，就能扛住50000个并发。

其中涉及的技术包括：Nginx、HAProxy，两者都是工作在网络第七层的反向代理软件，主要支持http协议，还会涉及session共享、文件上传下载的问题。

架构瓶颈

反向代理使应用服务器可支持的并发量大大增加，但并发量的增长也意味着更多请求穿透到数据库，单机的数据库最终成为瓶颈。

第四次演进

数据库读写分离

把数据库划分为读库和写库，读库可以有多个，通过同步机制把写库的数据同步到读库，对于需要查询最新写入数据场景，可通过在缓存中多写一份，通过缓存获得最新数据。

其中涉及的技术包括：Mycat，它是数据库中间件，可通过它来组织数据库的分离读写和分库分表，客户端通过它来访问下层数据库，还会涉及数据同步，数据一致性的问题。

架构瓶颈

业务逐渐变多，不同业务之间的访问量差距较大，不同业务直接竞争数据库，相互影响性能。

第五次演进

数据库按业务分库

把不同业务的数据保存到不同的数据库中，使业务之间的资源竞争降低，对于访问量大的业务，可以部署更多的服务器来支撑。

这样同时导致跨业务的表无法直接做关联分析，需要通过其他途径来解决，但这不是本文讨论的重点，有兴趣的可以自行搜索解决方案。

架构瓶颈

随着用户数的增长，单机的写库会逐渐会达到性能瓶颈。

第六次演进

把大表拆分为小表

比如针对评论数据，可按照商品ID进行hash，路由到对应的表中存储；针对支付记录，可按照小时创建表，每个小时表继续拆分为小表，使用用户ID或记录编号来路由数据。只要实时操作的表数据量足够小，请求能够足够均匀的分发到多台服务器上的小表，那数据库就能通过水平扩展的方式来提高性能。

其中前面提到的Mycat也支持在大表拆分为小表情况下的访问控制。这种做法显著地增加了数据库运维的难度，对DBA的要求较高。

数据库设计到这种结构时，已经可以称为分布式数据库但这只是一个逻辑的数据库整体，数据库里不同的组成部分是由不同的组件单独来实现的如分库分表的管理和请求分发，由Mycat实现，SQL的解析由单机的数据库实现，读写分离可能由网关和消息队列来实现，查询结果的汇总可能由数据库接口层来实现等等这种架构其实是MPP（大规模并行处理）架构的一类实现。

目前开源和商用都已经有不少MPP数据库，开源中比较流行的有Greenplum、TiDB、PostgresqlXC、HAWQ等，商用的如南大通用的GBase、睿帆科技的雪球DB、华为的LibrA等等不同的MPP数据库的侧重点也不一样，如TiDB更侧重于分布式OLTP场景。

Greenplum更侧重于分布式OLAP场景这些MPP数据库基本都提供了类似Postgresql、Oracle、MySQL那样的SQL标准支持能力，能把一个查询解析为分布式的执行计划分发到每台机器上并行执行，最终由数据库本身汇总数据进行返回也提供了诸如权限管理、分库分表、事务、数据副本等能力，并且大多能够支持100个节点以上的集群，大大降低了数据库运维的成本，并且使数据库也能够实现水平扩展。

架构瓶颈

数据库和Tomcat都能够水平扩展，可支撑的并发大幅提高，随着用户数的增长，最终单机的Nginx会成为瓶颈。

第七次演进

使用LVS或F5来使多个Nginx负载均衡

由于瓶颈在Nginx，因此无法通过两层的Nginx来实现多个Nginx的负载均衡。

图中的LVS和F5是工作在网络第四层的负载均衡解决方案，其中LVS是软件，运行在操作系统内核态，可对TCP请求或更高层级的网络协议进行转发，因此支持的协议更丰富，并且性能也远高于Nginx，可假设单机的LVS可支持几十万个并发的请求转发；

F5是一种负载均衡硬件，与LVS提供的能力类似，性能比LVS更高，但价格昂贵。

由于LVS是单机版的软件，若LVS所在服务器宕机则会导致整个后端系统都无法访问，因此需要有备用节点。

可使用keepalived软件模拟出虚拟IP，然后把虚拟IP绑定到多台LVS服务器上，浏览器访问虚拟IP时，会被路由器重定向到真实的LVS服务器当主LVS服务器宕机时，keepalived软件会自动更新路由器中的路由表，把虚拟IP重定向到另外一台正常的LVS服务器，从而达到LVS服务器高可用的效果。

此处需要注意的是，上图中从Nginx层到Tomcat层这样画并不代表全部Nginx都转发请求到全部的Tomcat在实际使用时，可能会是几个Nginx下面接一部分的Tomcat，这些Nginx之间通过keepalived实现高可用，其他的Nginx接另外的Tomcat，这样可接入的Tomcat数量就能成倍的增加。

架构瓶颈

由于LVS也是单机的，随着并发数增长到几十万时，LVS服务器最终会达到瓶颈，此时用户数达到千万甚至上亿级别，用户分布在不同的地区，与服务器机房距离不同，导致了访问的延迟会明显不同。

第八次演进

通过DNS轮询实现机房间的负载均衡

在DNS服务器中可配置一个域名对应多个IP地址，每个IP地址对应到不同的机房里的虚拟IP。

当用户访问www.taobao.com时，DNS服务器会使用轮询策略或其他策略，来选择某个IP供用户访问。此方式能实现机房间的负载均衡至此，系统可做到机房级别的水平扩展，千万级到亿级的并发量都可通过增加机房来解决，系统入口处的请求并发量不再是问题。

架构瓶颈

随着数据的丰富程度和业务的发展，检索、分析等需求越来越丰富，单单依靠数据库无法解决如此丰富的需求。

未完待续...

下篇我们将继续列举第九至十四次演进阶段会遇到的相关技术，及一些架构设计的原则，让大家对架构的演进有一个整体的认知。敬请期待~

END

链接：https://juejin.cn/post/7404262499774021670

本文为51Testing经授权转载，转载文章所包含的文字来源于作者。如因内容或版权等问题，请联系51Testing进行删除

点点赞

点分享

点在看

http://mp.weixin.qq.com/s?__biz=MjM5NTU0MDg0MA==&mid=2651323890&idx=1&sn=ba8062f3f0c031aff5714fc7a5a42503

51Testing软件测试网

博为峰20周年，青春正当燃，一起向未来！博为峰51Testing软件测试网提供各种线上招聘、线上课程等网络服务，出版软件测试系列丛书及电子杂志，组织线上技术交流活动；同时还举办多种线下公益活动，如软件测试沙龙、软件测试专场招聘会等。

最新文章

【小米招聘专场】月薪最高60K*14薪，雷军喊你速投简历！

开启RAG进阶：混合检索（关键字&向量）+重排序（原理讲解与示例体验）

从菜鸟到月薪2W+的测试经理，分享我10年的职业规划路线…

网红博主“羊毛月”嘲讽00后找不到工作，软件测试行业躺枪？

车载激光雷达的特点——【新书连载2】智能驾驶之激光雷达算法详解

用例自动化！测试人应对需求频繁变化的5大策略！

MobSF移动安全扫描平台本地化部署「本地部署方案」

书写简历的难点总结（内附获奖名单）

淘宝为什么能抗住90秒100亿？软件测试工程师必看！（二）

测试江湖：聊聊职场情绪管理

这7个最强Appium替代工具，移动应用自动化测试必备！

MobSF移动安全扫描平台本地化部署「docker方案」

埋点数据对不对？5步轻松搞定埋点测试！

产品需求交付质量保证的“七重门”

“初识激光雷达”——【新书连载1】智能驾驶之激光雷达算法详解

【腾讯招聘专场】月薪最高60K*16薪，新一轮扩张开始！

大模型之RAG：基于向量检索的理论与实战，对比关键字检索方案

“我，95后，毕业七年换了3份软件测试工作”，工资翻倍了……

揭秘游戏测试：《黑神话：悟空》如何成为现象级大作

学会这些，扔掉测试人常背的3口“锅”！

从5.6秒到1秒！Nginx性能调优实战之1秒内响应千并发！

Faker：自动化测试数据生成利器

团队和个人选择缺陷管理工具的4点区别（内附获奖名单）

淘宝为什么能抗住90秒100亿？软件测试工程师必看！

测试江湖：从阿里P8大牛征婚聊起

测试人面试的底层逻辑：10条潜规则让你脱颖而出！

Java中的负载测试：从单元测试到集成测试的完整覆盖策略

网络性能测试神器：iperf3工具全攻略

【AI大模型】在健康睡眠监测中的深度融合与实践案例

Python自动化操作：简单、有趣、高效！解放你的工作流程！

【小鹏汽车招聘专场】月薪13~50K，抢抓AI汽车新风口！

从 ROI 出发探究自动化测试

初入测试界，3年后薪资翻倍：聊聊我的测试进阶历程，值得借鉴

解锁AI测试新技能：模型算法测试之模糊测试

测试人世纪难题：如何写“好”测试用例？

比Locust好用！推荐一款高并发场景下的稳定性压测利器

深度解析：李彦宏“不要卷模型，要卷应用”

选择无代码测试工具时必须要考虑的7点因素（内附获奖名单）

压箱底神器：9个你必会的测试效率提升工具！

测试江湖：为什么大多数人宁愿吃生活的苦，也不愿意吃学习的苦

这7款主流的测试缺陷管理工具，你必须知道！

大模型之RAG：关键字检索的认识与实战（混合检索进阶储备）

快速指南 | 如何搭建一个高效的UI自动化测试平台

打造专属手机助手：用 PyQt6 玩转 ADB

14年测试人最近的面试经历，值得借鉴√

【华为招聘专场】月薪最高60K*18薪，7大热门城市招人！

Web 页面性能衡量指标-以用户为中心的效果指标（下）

迷茫了3年：做完这个测试项目，我终于决定辞职！

数据正确性测试全攻略：核心方法与实例剖析

自动化横行的今天，手工测试如何杀出一条血路？

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉