
简介《深信服信云sCloud_SCP用户手册_V6.2.60》是深信服科技发布的云计算平台官方手册版本6.2.60发布日期为2021-02-05。手册面向网络设计工程师和运维人员系统介绍了sCloud_SCP的产品架构、关键特性、平台部署与运维管理包括计算节点、存储节点、网络节点等组件组成以及高性能计算、高可靠性存储、高可扩展性等特性并覆盖环境准备、软件安装、配置设置等部署步骤以及资源管理、故障处理、安全管理等运维要点。资源为单个PDF文件大小约11.93MB适合作为平台学习、方案设计和日常维护的参考文档。已有261人学习下载内容结构清晰包含前言、目录、产品说明等章节并附有符号约定、修订记录、资料获取与技术支持信息便于读者快速定位所需内容提升对深信服信云平台的理解与操作能力。1. 深信服信云 sCloud_SCP 用户手册 V6.2.60从物理机到云主机的交付闭环第一次翻这份深信服信云 sCloud_SCP 用户手册 V6.2.60我的直观感受是它没把力气花在罗列功能上而是把一套私有云从加电到交付的完整路径摆了出来。六章内容覆盖了部署安装、资源初始化、平台配置、可靠中心和监控告警核心是告诉你怎么把一批物理服务器变成可对外提供云主机的资源池再通过 HA、DRS、备份 CDP 这些手段让平台在故障面前不至于翻车。适合两类人一是刚接手私有云交付的网络设计工程师需要照着它推流程二是驻场运维需要在线上环境出问题时快速定位是资源池、网络出口还是集群授权的问题。我建议把云主机生命周期和可靠中心两章当主阅读章节这两部分决定平台交付后你半夜能不能睡踏实。2. 产品架构与安装部署三类节点分工和授权交付的关键点2.1 从产品架构反推部署顺序计算、存储、网络节点怎么分工手册在产品说明章节对架构做了定义核心分三类节点计算节点负责云主机的 CPU 和内存存储节点负责数据持久化和多副本网络节点承载 VPC、分布式防火墙这类虚拟网络功能。在超融合形态下这三类角色通常跑在同一批 x86 服务器上通过软件定义的方式区分职能。理解这个架构不是为了读概念而是为了反推部署顺序——你得先让网络可通、存储可写、计算可调度后续的云主机创建才有落脚点。三类节点的规划重点也不同交付前最好先确认清楚。节点角色核心职责配置关注点计算节点运行云主机分配 CPU、内存高主频 CPU、内存插满、预留虚拟化开销存储节点多副本、CDP、数据重建大容量 SSD/HDD 混插、RAID 策略、坏盘冗余网络节点VPC、分布式防火墙、弹性 IP万兆网卡、VLAN 划分、南北向流量带宽我在做交付时一般先画一张节点拓扑表把每台服务器的管理 IP、业务 IP、存储 IP 三张网卡地址列全再开始装平台。原因很简单平台装完后再去补网络规划容易产生地址冲突后面排查起来相当被动。这张表既是部署依据也是后期告警定位时对照的基线。2.2 安装流程与平台授权从环境准备到登录信息的完整链路手册给出的安装链路是标准的安装前准备、产品安装、平台授权、时间设置可选、平台登录信息。安装前准备包含的物理条件主要是服务器上架、存储就位、网络接通产品安装是平台软件本身的部署动作平台授权则是让平台从“能看不能用”变成“能真正对外提供服务的门槛”。这里有一个容易混淆的点平台授权和后面的集群授权是两层概念平台授权解决的是整个平台能不能合法运行集群授权解决的是具体资源池里的计算节点能不能被调度。两者漏了任何一个都会在创建云主机时报错。我一般会建议在正式安装前先验证所有硬件健康状态。常见做法是巡检脚本扫一遍管理面的连通性而不是直接进安装流程。一个基础巡检脚本如下#!/bin/bash # 物理资源入池前巡检脚本在管理节点执行 # 只检查三类角色的管理网络连通性实际环境请自行替换 IP NODES192.168.10.11 192.168.10.12 192.168.10.13 # 计算/存储/网络节点管理IP for node in $NODES; do ping -c 2 -W 2 $node /dev/null 21 \ echo [OK] $node 管理网络可达 \ || echo [FAIL] $node 管理网络不可达检查网线/交换机 VLAN done # 时间同步检查平台所有节点必须处于同一时钟域 for node in $NODES; do echo -n $node 时间偏差: ssh $node date %s | awk -v local$(date %s) {print $1-local 秒} done这个脚本的逻辑分两块ping 部分只验证 L3 连通能挡住网线插错、VLAN 不通这类低级问题时间偏差部分用于判断节点时钟是否一致。时间同步在安装阶段看似无关紧要但后面 CDP 增量备份对齐、告警时间戳排序都依赖全局一致的时间。如果某个节点时间偏差超过 30 秒建议先修 NTP 再往下走否则后续排查问题会出现“同一故障两个时间线”的混乱局面。2.3 时间设置与登录信息两个容易被忽略的交接点手册里时间设置标注为可选但生产环境我强烈建议强制启用 NTP并指定统一的时间源。云平台里日志是最重要的排障依据如果各个节点的时间各走各的那告警排序、HA 触发记录、数据重建进度都会对不上排查故障基本靠猜。时间设置的操作在平台基本管理内常见做法是指定一台内网 NTP 服务器然后把所有节点指向它而不是依赖外网时间源。平台登录信息是交付给用户的钥匙包含管理地址、管理员账号和初始密码。这里有一个常见的交付习惯问题很多实施人员装完平台后保持默认密码不变直接交给客户。我个人的习惯是首次登录后强制改密并把登录信息单独归档到交接文档里而不是留在平台备注里。平台 IP 设置在系统配置中建议提前规划好管理 IP 和业务 IP 的网段隔离。如果管理面混在业务网段里一旦业务流量异常管理面可能跟着失去响应。3. 资源初始化是平台的第一道关入池顺序、集群授权与出口规划3.1 添加物理资源与划分资源池入池顺序为什么不能乱资源初始化流程是手册明确规定的先添加物理资源再划分资源池然后做集群授权最后规划 VPC 网络出口和企业专线出口。为什么顺序不能乱添加物理资源是让平台“看得见”服务器划分资源池是决定这些资源归谁调度集群授权决定算力能不能真正对外分配网络出口规划决定云主机创建后能不能上网、能不能被外部访问。任何一步跳过去后面都会回退补做补做时往往要连同网络拓扑一起改返工量很大。添加物理资源的操作逻辑很简单准备一台符合要求的物理服务器配置好 IPMI/BMC 管理地址接入平台管理网络然后从平台界面向导里执行添加。平台会通过管理通道自动发现硬件信息并将服务器纳入待分配状态。这一步如果一直发现不了设备先排查 IPMI 用户名密码和网段可达性再排查平台侧的 VLAN 配置不要一上来就怀疑服务器硬件。划分资源池是逻辑操作它把若干台物理服务器绑定为一个可调度的集群资源集合。资源池的划分粒度直接决定后续的租户隔离和故障域边界。我的习惯是把同一个机柜、同一批同时上线的机器划到同一个资源池避免后期出现“资源池 A 满了但资源池 B 空闲”的调度僵局。资源池创建完成后需要手动执行同步数据操作让平台刷新物理机的实时状态。3.2 集群授权单集群与多集群的差别集群授权是很多人第一次上手时忽略的环节。手册里把它分为单集群授权和多集群授权两类。单集群授权适用于一个资源池对应一个集群的场景配置简单只需要把资源池所有节点加入授权范围即可。多集群授权适用于跨机房、多资源池统一管理的场景授权操作一次覆盖多个集群避免每个集群单独维护授权文件。授权动作发生后我在交付中通常立刻验证两个点一是所有节点状态是否从“未授权”变为正常二是尝试创建一台最小规格的测试云主机确认资源能够成功分配。这里的踩坑集中在“授权做了但节点实际未生效”常见原因是授权文件与节点序列号不匹配或者授权时漏选了某个新加入的资源池。对于多集群场景授权前先确认所有集群都在列表中不要凭记忆勾选。如果不确定授权范围宁可先最小授权一批节点跑通流程再逐步扩容不要一次把一个跨机房的全部节点都押在单次授权上。3.3 VPC 网络出口与企业专线出口规划的关键参数网络出口规划是资源初始化的最后一环但又是云主机真正能用起来的前提。VPC 网络出口解决的是云主机和外部网络之间的南北向通信规划时主要确定出口网段、弹性 IP 池的地址范围和路由方式。企业在规划时容易犯的错是地址段太随意和现有物理网络冲突导致创建弹性 IP 后出现“能通却不能上网”的疑难杂症。建议在初始化前就画一张地址规划表把平台管理网段、VPC 业务网段、弹性 IP 池段分开段与段之间预留扩展空间。企业专线出口解决的是跨机房或跨园区的互联需求和 VPC 出口职责不同通常在多站点部署时使用。出口类型解决什么问题规划关键点VPC 网络出口云主机访问外网/被外网访问网段隔离、路由策略、NAT 规则企业专线出口跨机房二三层互联专线网段、对端路由、冗余链路我在做出口规划时有一个习惯先确认业务对外的 IP 需求数量和增长趋势再确定弹性 IP 池的大小。弹性 IP 池规划得过大容易造成地址浪费过小会导致后期频繁扩容。扩容本身不难但地址段变更会牵连到分布式防火墙策略和路由配置涉及面不小。所以初始化阶段宁可多预留一倍也不要刚好卡在边界上。4. 平台配置实战云主机生命周期与网络管理的关键参数4.1 创建云主机镜像、计算规格与期限设置的参数链路创建云主机是平台配置阶段最频繁的操作也是参数链路最长的一个动作。关键参数包括镜像、计算规格、网络、存储策略和期限设置。镜像决定了云主机的操作系统环境公共镜像由平台管理员预置私有镜像可以通过上传 ISO 或把现有云主机转为镜像来生成。计算规格决定 CPU 和内存配比网络决定云主机归属哪个 VPC、是否分配弹性 IP存储策略决定数据放在哪个资源池和副本策略。期限设置这一项值得专门注意。手册将设置期限作为创建云主机后的独立操作可以给云主机指定到期时间到期后自动回收或触发提醒。这个机制在测试环境特别实用比如给临时验证用的云主机设 7 天期限到时间直接回收避免资源被闲置占用。生产环境的云主机通常不设期限或设长期限由运营中心通过配额和工单流程管控。我在交付测试环境时都要求实施人员给每台测试机显式设置期限宁可错杀也不让资源池被僵尸云主机占满。创建云主机的核心参数链路如下表所示参数建议说明镜像优先使用公共镜像公共镜像经平台验证驱动和虚拟化兼容性更好计算规格按业务峰值评估迁移云主机可热迁移但规格调整要先关机存储策略生产环境多副本多副本牺牲容量换可用性测试环境可调低期限测试机必须显式设置到期自动回收防止资源浪费4.2 迁移、导出、分配与回收四个高频运维动作云主机管理章节里除了创建之外使用频率最高的四个运维动作是迁移、导出、分配和回收。迁移云主机通常发生在宿主机需要硬件维护、故障规避或负载均衡的时候。迁移分为热迁移和冷迁移两种路径热迁移期间业务不中断但对目标资源池的剩余资源要求更高。如果目标资源池没有足够的余量迁移任务会长时间停留在等待状态。我一般会在迁移前先同步一次资源池数据确认目标节点的 CPU、内存余量足够再发起迁移。导出云主机是把云主机转成镜像文件的过程常用于备份归档或跨平台迁移。导出时需要注意云主机的运行状态部分版本对运行中的云主机导出支持有限建议先关机再导出避免镜像文件不一致。分配和回收是运营层面的动作分配是把云主机交付给租户回收是租户释放资源后把云主机删除并归还资源。回收操作要优先确认云主机上的数据已经完成备份或迁移否则一个误操作就会造成数据丢失。我在这个环节加入了一道防线通过脚本模板发起创建请求参数链路与手动创建保持一致# 通过平台 API 创建云主机骨架示例参数按实际环境替换 # 目标把创建参数沉淀为脚本避免每次手动配置造成口径不一致 payload { name: prod-web-01, resource_pool_id: pool-uuid-xxx, # 从资源池列表接口获取 image_id: img-centos-7.9-x64, # 公共镜像或私有镜像 ID flavor: {cpu: 4, memory_mb: 8192}, # 4C8G按业务需求调整 network: { vpc_id: vpc-xxx, eip: True, # 需要外网访问时开启 }, storage: {replica: 2, disk_gb: 100}, # 双副本100G 数据盘 expire_at: 2025-12-31 23:59:59, # 期限字段生产环境可空 } r session.post(f{BASE_URL}/instances, jsonpayload, verifyFalse) print(r.status_code, r.json()) # 201 表示创建任务已下发这段代码里最关键的是 expiration 和 storage 两个字段前者是云主机回收的触发条件后者决定了数据可靠性。很多自动化创建脚本只关注 CPU 内存把存储和期限忘了结果平台里跑出一批“三无云主机”——无副本保护、无到期时间、无业务归属。我从吃过亏后就强制在脚本模板里补齐所有字段宁可多传参数也不依赖平台默认值。4.3 弹性 IP 池与分布式防火墙网络管理中的两个重点网络管理章节除了基础拓扑两个实际使用频率最高的功能是弹性 IP 池和分布式防火墙。弹性 IP 池管理平台可分配的公网或业务网地址创建云主机时可以从池中分配弹性 IP。规划弹性 IP 池时要注意网段归属如果弹性 IP 网段和物理网络已有网段重叠会出现云主机能获取 IP 但网关不通的现象。一个有效的规避方式是在初始化阶段就把弹性 IP 池单独规划在一个独立网段并在物理交换机上做好路由宣告不要让它和业务内网共享网段。分布式防火墙是平台网络功能中的一个关键设计策略不经过物理防火墙而是下发到虚拟交换机层直接对云主机网卡生效。这种方式的好处是东西向流量也能被策略管控而传统防火墙在云环境下只能控制南北向。使用分布式防火墙时先定义安全组再把云主机纳入安全组最后配置策略规则规则从上到下匹配第一条命中的规则生效。排障时最常见的问题是策略放行顺序不对导致云主机之间互访失败这时检查 VPC 内部的拓扑视图和防火墙策略命中次数比在物理网络上抓包快得多。5. 可靠中心与运维避坑HA、DRS、备份 CDP 和 5 个翻车点5.1 业务可靠服务本地备份 CDP、异地容灾、HA、DRS 的配合可靠中心是这份手册里信息密度最高的部分。业务可靠服务包含本地备份和 CDP、异地容灾、故障迁移 HA、动态资源调度 DRS、资源预留等能力。这些能力不是各自独立的开关而是一套需要联动配置的可靠性链路。本地备份解决的是数据备份和恢复CDP 解决的是崩溃一致性保护按时间点做增量记录异地容灾解决的是跨站点级别的业务连续性HA 解决的是单个宿主机故障时云主机自动迁移DRS 解决的是集群内资源负载不均时自动调度。这几个能力在实际配置中有一个配合关系。HA 依赖的资源保障来自资源池的预留空间如果资源池已经被业务占满HA 在宿主机宕机后可能找不到目标节点拉起故障云主机。DRS 的作用是在日常运行中打散热点让集群内每台物理机的负载相对均匀为 HA 预留出足够的余量。CDP 则独立于 HA 工作哪怕云主机没有出现迁移也能通过 CDP 把数据恢复到某个历史时间点。运维人员不能只配 HA 不配 DRS也不能只做备份不配置 CDP 的策略这四者要当成一个整体来看。我一般在生产环境这样分配可靠等级核心数据库云主机开多副本加 CDP备份周期按 15 分钟增量执行普通业务云主机开 HA 和 DRS 即可测试云主机不设 HA因为回收优先级高于可用性。这个分级思路可以控制存储成本又保证核心业务不悬空。5.2 平台可靠与硬件可靠多副本、数据重建、硬件健康检测平台可靠服务关注的是平台自身的运行状态包括资源过载状态、网络配置状态、多副本状态和数据重建状态。资源过载状态反映集群 CPU 或内存是否逼近上限网络配置状态反映 VPC 和物理网络的配置一致性多副本状态反映存储副本是否完整数据重建状态反映坏盘后的重建进度。这几个状态建议每周检查一次因为它们的异常不会直接报警但一旦触发往往意味着数据安全已经受到影响。硬件可靠服务通过硬件健康检测来实现覆盖 CPU、内存、磁盘、电源、风扇等物理组件。健康检测发现异常后配合告警设置能提前发现故障苗头。这里的实用经验是不要把硬件告警阈值设得过于灵敏否则每天都会被轻微坏道或风扇转速波动刷屏真正严重的故障反而被淹没在告警堆里。我会把告警分为三级紧急、重要、提醒紧急走短信或电话通知重要走邮件提醒只在控制台里展示。5.3 避坑记录从资源初始化到日常运维的 5 个踩坑点以下是这版手册对应版本在实际交付环境里最常见的几个坑每条按现象、原因、解决记录坑一资源池数据不刷新现象创建完云主机后云主机列表刷不出新机器但资源池详情里能看到资源用量增加。 原因资源池没有执行同步数据平台展示层的数据滞后。 解决进入资源池详情执行同步数据操作同步周期一般为分钟级执行后列表即刷新。变更操作后养成同步资源的习惯不依赖自动刷新。坑二新增节点无法分配资源现象向集群新增物理机后新节点在列表中状态正常但创建云主机时资源始终无法调度到该节点。 原因新节点没有纳入集群授权范围属于“已纳管但未授权”状态。 解决在集群授权里重新执行授权操作涵盖新节点也可以在初始化阶段就把集群授权一次性覆盖到所有预留节点。坑三弹性 IP 池地址冲突现象云主机分配了弹性 IP 后外部访问时通时不通ping 网关丢包。 原因弹性 IP 池网段与物理网络已有网段重叠路由被物理交换机优先匹配。 解决重新规划弹性 IP 网段释放冲突地址并在物理交换机和平台路由层面同时调整。规划阶段给弹性 IP 池预留独立网段是最省心的方式。坑四HA 触发后云主机迟迟不拉起现象一台宿主机宕机后HA 触发但业务云主机在目标资源池中长时间处于“创建中”或“等待调度”状态。 原因目标资源池计算资源余量不足云主机无法获得足够的 CPU 内存。 解决配置 HA 的同时开启 DRS 打散负载并在资源池中预留一定的空闲余量。资源预留配置不可过小否则 HA 等于空转。坑五告警日志刷屏现象告警日志里全是同一个低级别事件的重复记录真正的高级别告警被淹没。 原因告警设置没有分级管理所有事件都进入同一个通知通道。 解决按紧急、重要、提醒三级设置告警规则并对同一事件做收敛处理设置重复通知的时间间隔。6. 变更后的验证清单十分钟检查链路6.1 从创建云主机到告警回扫的检查路线平台变更操作完成后我习惯走一条固定的检查链路大约需要十分钟覆盖从资源到网络再到可靠性的完整闭环顺序检查项位置通过标准1资源池同步资源池详情新云主机/新节点出现在列表中2网络拓扑网络管理-网络拓扑云主机网卡和 VPC 连接状态正常3分布式防火墙策略安全组策略已命中放行方向正确4弹性 IP弹性 IP 池地址分配无冲突外部 ping 通5HA/DRS 状态可靠中心无待处理告警资源余量充足6告警日志告警日志无新增紧急告警这条链路的核心思路是先确认资源被平台看见再确认网络路径通畅然后确认安全策略没拦截最后确认可靠性机制没有因为这次变更引入新告警。每个环节都是上一个环节的验证前提跳过任何一步都可能在事后以隐蔽的方式暴露问题。6.2 检查习惯与判断标准这套检查链路的判断标准不难记资源可见、网络可通、策略命中、故障可迁移、日志干净。资源不可见就执行同步网络不通就查拓扑和路由策略不命中就先放通再收敛HA 不触发就看资源余量日志有告警就按级别分类处理。整套检查下来多数变更操作的风险都在可接受范围内。作为一个驻场运维我最怕的不是大故障而是变更做完之后没人知道埋了什么雷。从那以后我每次处理完任何平台变更不管大小都强制走一遍这条十分钟的检查链路形成肌肉记忆。这个习惯帮我挡掉了不少隔夜翻车的场面也希望帮到你。本文还有配套的精品资源点击获取