ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Data-Science-For-Beginners 云端课 18:Azure ML 低代码/无代码方式实战——AutoML 训练、部署并消费心衰预测模型

2026/9/14 17:12:30 拓冰建站 浏览量
Data-Science-For-Beginners 云端课 18:Azure ML 低代码/无代码方式实战——AutoML 训练、部署并消费心衰预测模型 Data-Science-For-Beginners 云端课 18Azure ML 低代码/无代码方式实战——AutoML 训练、部署并消费心衰预测模型【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本文基于 Data-Science-For-Beginners 仓库第 18 课《Data Science in the Cloud: The Low code/No code way》带你完整走一遍在 Azure Machine Learning Studio 中以低代码/无代码GUI AutoML方式训练、部署并消费一个心血管疾病CVD风险预测模型的全流程创建 Azure ML 工作区与计算集群、上传 Kaggle 心衰数据集、用 AutoML 自动完成分类实验最后把最优模型发布为 Web 服务并通过 REST 端点从本地 Python 脚本调用。读完你可以独立完成一条不写训练代码的云端 ML 工作流并理解低代码路线与 SDK 代码化路线第 19 课的适用边界。1. 课程定位同一项目两条实现路径本仓库的 5-Data-Science-In-Cloud/README.md 说明了Data Science in the Cloud模块共三课先讲为什么用云17-Introduction再用低代码/无代码方式18-Low-Code即本篇与Azure ML SDK 方式19-Azure分别构建同一个心衰预测模型。两条路径共享同一个 Kaggle 心衰数据集目标完全一致只是实现手段不同维度Low code/No code本讲Azure ML SDK19-Azure代码能力要求不需要需要开发速度快且简单取决于编码能力生产就绪程度否是原文档给出的判断是低代码路线通过图形界面GUI操作、无需编程背景适合快速验证项目可行性、搭建 POCProof Of Concept但当项目规模扩大、需要生产化时仅靠 GUI 创建资源不再现实必须用 Azure ML SDK 把创建资源 → 训练 → 部署全链路程序化自动化。仓库中对应的 SDK 实现可对照 5-Data-Science-In-Cloud/19-Azure/notebook.ipynb 查看该 notebook 即第 19 课的代码化版本。本篇聚焦左侧低代码路径所有操作均在 Azure 门户 / Azure ML Studio 界面内完成。本讲原文档同时提供英文原版 5-Data-Science-In-Cloud/18-Low-Code/README.md 与多语言翻译版本篇对应芬兰语版 translations/fi/5-Data-Science-In-Cloud/18-Low-Code/README.md英文原版为权威表述翻译版末尾附有 AI 翻译免责说明。2. 什么是 Azure Machine Learning数据科学家在探索数据、预处理数据以及尝试各类训练算法上投入大量时间这些任务耗时且常常低效地消耗昂贵的计算硬件。Azure ML 正是为此设计的云端 ML 平台它覆盖数据准备、模型训练、预测服务发布与使用监控通过自动化训练环节中的重复性工作提升效率并提供可弹性伸缩的云端计算资源——仅在实际使用时才产生费用。原文档列出的 Azure ML 工具清单如下完整继承Azure Machine Learning StudioAzure ML 的 Web 门户提供模型训练、部署、自动化、跟踪与资产管理的低代码/无代码入口与 Azure ML SDK 集成保证一致的体验。Jupyter Notebooks快速原型设计与测试 ML 模型。Azure Machine Learning Designer以拖拽模块的方式搭建实验、并在低代码环境中发布流水线。Automated machine learning UIAutoML自动化 ML 模型开发中的迭代性工作使数据科学家、分析师与开发者都能以高规模、高效率与高生产率构建模型同时保持模型质量。本讲的核心工具。Data Labelling辅助式 ML 工具自动为数据打标签。Visual Studio Code 机器学习扩展构建与管理 ML 项目的完整开发环境。Machine learning CLI从命令行管理 Azure ML 资源。开源框架集成PyTorch、TensorFlow、Scikit-learn 等覆盖训练、部署与管理的全流程。MLflow管理 ML 实验生命周期的开源库其中MLflow Tracking组件负责记录与跟踪训练运行指标及模型产物且不依赖实验所在环境。3. 心衰预测数据集心血管疾病CVD是全球头号死因占全球死亡总数的 31%。吸烟、不健康饮食与肥胖、缺乏运动、酗酒等不良环境/行为因素都可以作为估计模型的输入特征能评估某人发生 CVD 事件的概率对于高危人群的预防极具价值。本讲使用 Kaggle 公开的Heart Failure Clinical Data数据集。这是一个表格型数据集13 列12 个特征 1 个目标变量、299 行。字段定义如下表目标列 DEATH_EVENT 表示患者在随访期内是否死亡序号字段名类型说明示例1age数值型患者年龄252anaemia布尔型红细胞或血红蛋白减少贫血0 或 13creatinine_phosphokinase数值型血液中 CPK肌酸磷酸激酶水平5424diabetes布尔型患者是否患糖尿病0 或 15ejection_fraction数值型每次心跳泵出心室的血液百分比射血分数456high_blood_pressure布尔型患者是否患高血压0 或 17platelets数值型血液中血小板数量1490008serum_creatinine数值型血清肌酐水平0.59serum_sodium数值型血清钠水平原文档示例值占位10sex布尔型性别男/女0 或 111smoking布尔型患者是否吸烟0 或 112time数值型随访期天数413DEATH_EVENT目标布尔型患者是否在随访期内死亡0 或 1注意第 9 行 serum_sodium 的示例值在原文档中是一个明显的笔误原文写作 jun并非数值从字段说明看它应为血清钠数值如 137后文部署消费示例中使用的正是serum_sodium: 137。拿到数据集后即可开始在 Azure 上搭建项目。4. 创建 Azure ML 工作区要训练模型首先要创建工作区workspace。工作区是 Azure Machine Learning 的顶层资源集中管理你在使用 Azure ML 时创建的全部产物它记录所有训练运行的历史——日志、指标、输出以及脚本快照供你判断哪次训练产出了最佳模型。建议使用与操作系统兼容的最新浏览器官方支持的浏览器为Microsoft Edge新版 Edge最新版本不含 Edge legacySafari最新版仅 MacChrome最新版Firefox最新版费用提示原文档 NOTE只要 Azure ML 工作区存在于你的订阅中订阅就会因数据存储空间收取少量费用。因此原文档建议在不再使用时删除工作区。创建步骤完整继承原文档操作序列用与 Azure 订阅关联的 Microsoft 凭据登录 Azure 门户portal.azure.com。点击Create a resource搜索 Machine Learning 并选中该磁贴点击 create。填写设置项Subscription订阅你的 Azure 订阅Resource group资源组新建或选择已有资源组Workspace name工作区名取一个全局唯一的名称Region区域选择离你最近的地理区域Storage account存储账户注意默认会为你的工作区新建一个存储账户Key vault密钥保管库注意默认会新建一个密钥保管库Application insights应用洞察注意默认会新建一个应用洞察资源Container registry容器注册表选 None——首次把模型部署为容器时会自动创建。点击create review再点击create。等待工作区创建完成可能需要几分钟在门户中通过 Machine Learning 服务找到它并进入。在工作区 Overview 页面启动Azure Machine Learning Studio或直接在新标签页打开 ml.azure.com用 Microsoft 账户登录如被提示选择你的 Azure 目录、订阅与工作区。在 Studio 中点击左上角 ☰ 图标展开左侧导航即可看到用于管理工作区资源的各个页面。原文档指出工作区也可以用 Azure 门户管理但对数据科学家和 ML 运维工程师而言Azure ML Studio 提供了更聚焦的资源管理界面后续所有操作计算、数据集、AutoML、部署都在 Studio 中完成。5. 计算资源类型、选型与创建计算集群5.1 四类计算资源计算资源Compute Resources是承载模型训练与数据探索的云端资源共四种Compute Instances计算实例数据科学家操作数据与模型的开发工作站。本质是创建一台虚拟机VM并启动 notebook 实例然后可以从 notebook 中调用计算集群来训练模型。Compute Clusters计算集群VM 的可伸缩集群用于按需处理实验代码训练模型时必须使用。集群可使用专用的 GPU 或 CPU 资源。Inference Clusters推理集群预测服务的部署目标承载已训练模型的推理。Attached Compute附加计算链接到已有的 Azure 计算资源如虚拟机或 Azure Databricks 集群。5.2 选型的关键决策创建计算资源时的几个选项是关键决策原文档归纳为四个问题1CPU 还是 GPUCPU 是执行计算机程序指令的电子电路擅长快速处理宽泛任务但并发任务数量有限GPU 是专为高并发图形/并行计算设计的电路更适合深度学习任务。对比表CPUGPU更便宜更贵并发级别较低并发级别高训练深度学习模型较慢最适合深度学习本讲的分类任务是传统机器学习AutoML 会比较线性模型、树模型等算法并非深度学习因此选CPU即可。2集群规模Cluster Size更大的集群更贵但响应更快。有时间没预算 → 从小集群开始有预算没时间 → 用大集群。3VM 规格VM Size受时间与预算约束可在 RAM、磁盘、核心数、主频上权衡这些参数越高越贵但性能越好。4Dedicated专用还是 Low-priority低优先级实例低优先级实例是可中断的——Azure 可以回收这些资源转派其他任务从而中断你的作业专用实例则非经你许可不会终止。这同样是时间换金钱可中断实例更便宜。5.3 创建计算集群的具体步骤在已创建的工作区中进入Compute菜单 →Compute cluster选项卡 → 点击 New选择选项Dedicated vs Low priority、CPU 或 GPU、VM 规格与核心数本项目保持默认即可。点击Next。为集群起一个计算名称。选择参数最小/最大节点数、空闲多少秒后缩容、SSH 访问。注意最小节点数设为 0 时集群空闲期间可省钱最大节点数越高训练越快。原文档推荐的最大节点数为 3。点击Create此步骤可能需要几分钟。计算集群就绪后下一步把数据加载进 Azure ML Studio。6. 上传数据集在工作区左侧菜单点击Datasets→ Create dataset选择From local files选中先前从 Kaggle 下载的 CSV 文件。为数据集命名、指定类型与描述点击Next从文件上传数据再点Next。在Schema页为以下六个字段把数据类型改为Booleananaemia、diabetes、high_blood_pressure、sex、smoking、DEATH_EVENT与第 3 节字段表中的布尔列一一对应。点击Next→Create。数据集就位、计算集群创建完成后即可开始训练。7. 用 AutoML 做低代码/无代码训练传统 ML 模型开发是资源密集型工作需要领域知识且要花大量时间产出并比较几十个模型。AutoMLAutomated machine learning正是对这一迭代过程的自动化让数据科学家、分析师与开发者都能以高规模、高效率构建模型并维持模型质量显著缩短到生产就绪模型的时间。操作步骤完整继承在左侧菜单点击Automated ML选中刚上传的数据集点击Next。输入新的实验名称、**目标列DEATH_EVENT**以及第 5 节创建的计算集群点击Next。选择任务类型Classification点击Finish。此步骤耗时约30 分钟到 1 小时取决于计算集群规模。运行完成后点击Automated ML选项卡 → 点击你的运行 → 点击Best model summary卡片上的算法名。这里可以看到 AutoML 生成的最佳模型的详细描述也可以在Models选项卡中查看其余模型并用Explanations (preview)按钮花几分钟研究各模型的解释。选定要使用的模型后本讲直接使用 AutoML 选出的最佳模型即可进入部署环节。8. 低代码部署模型并消费端点8.1 模型部署部署Deployment是把模型集成为可基于新数据做预测、并能发现潜在改进空间的服务。对心衰项目而言把模型发布为 Web 服务意味着医疗应用可以实时调用它来评估患者发生心梗的风险。AutoML 界面允许用很少的步骤完成发布在最佳模型的描述页点击Deploy按钮。填写名称、描述计算类型选择Azure Container Instance勾选启用身份验证authentication点击Deploy。此步骤约需20 分钟。部署过程包含多个阶段注册模型、生成资源、为 Web 服务配置这些资源Deploy status下方会显示状态信息需定期点Refresh刷新状态变为Healthy即表示部署完成并在运行。部署完成后点击Endpoint选项卡并点击刚部署的端点——这里汇集了该端点的全部关键信息。8.2 消费端点REST Python点击Consume选项卡可以看到REST 端点地址与一份可直接运行的Python 消费脚本——该脚本可以直接在本地机器上执行来调用你的端点。重点看这两行url http://98e3715f-xxxx-xxxx-xxxx-9ec22d57b796.centralus.azurecontainer.io/score api_key # Replace this with the API key for the web serviceurl即 Consume 选项卡中的 REST 端点api_key是同一选项卡中的主密钥仅在启用身份验证时需要。脚本正是靠这两者消费端点。直接运行脚本预期输出b{\\result\\: [true]}即对脚本自动生成的默认输入各特征全为 0 / false模型预测心衰为true——这与输入全为零值时模型倾向于给出阳性判断的行为一致。把输入替换为如下示例数据两条记录一条全零、一条贴近真实患者60 岁、射血分数 38、血小板 260000、随访 130 天data { data: [ { age: 0, anaemia: false, creatinine_phosphokinase: 0, diabetes: false, ejection_fraction: 0, high_blood_pressure: false, platelets: 0, serum_creatinine: 0, serum_sodium: 0, sex: false, smoking: false, time: 0, }, { age: 60, anaemia: false, creatinine_phosphokinase: 500, diabetes: false, ejection_fraction: 38, high_blood_pressure: false, platelets: 260000, serum_creatinine: 1.40, serum_sodium: 137, sex: false, smoking: false, time: 130, }, ], }脚本应返回b{\\result\\: [true, false]}至此你完成了在 Azure ML 上的模型训练、部署与端点消费——全程无需编写训练代码。费用提示原文档 NOTE项目结束后请删除所有相关资源工作区、计算集群、ACI 部署等避免持续计费。9. 挑战题、复习与课后作业 挑战Challenge仔细研究 AutoML 为排名靠前的模型生成的解释与细节——尝试理解为什么最佳模型优于其他模型AutoML 比较了哪些算法它们之间有何差异为什么最佳模型在此场景下表现更好复习与自学习Review Self Study本讲的核心收获是学会在云端以低代码/无代码方式训练、部署并消费一个心衰风险预测模型。若尚未完成请深入 AutoML 的模型解释弄明白最佳模型胜出原因如需进一步学习低代码/无代码 AutoML原文档推荐延伸阅读 AutoML 首个实验教程Azure 官方文档 docs.microsoft.com 上的 tutorial-first-experiment-automated-ml 一文。课后作业Assignment见 translations/fi/5-Data-Science-In-Cloud/18-Low-Code/assignment.md英文原版为 5-Data-Science-In-Cloud/18-Low-Code/assignment.md。作业要求你自行寻找一份数据可在 Kaggle 或 Azure Open Datasets 中找完整走一遍训练 → 部署 → 消费流程评分细则Rubric分三档优秀Exemplary合格Adequate待改进Needs Improvement上传数据时按需修改了特征类型并在必要时清洗了数据用 AutoML 训练并查看了模型解释部署最佳模型且成功消费上传数据时按需修改了特征类型用 AutoML 训练、部署最佳模型且成功消费部署了 AutoML 训练出的最佳模型并成功消费10. 本篇要点回顾低代码路线的价值与边界Azure ML Studio 的 GUI AutoML 让零编码基础的人也能在云里完成端到端 MLPOC 场景生产化、自动化必须转向 Azure ML SDK对应仓库 5-Data-Science-In-Cloud/19-Azure/README.md 与 5-Data-Science-In-Cloud/19-Azure/notebook.ipynb。工作区是顶层资源集中管理数据、计算、代码、模型与运行历史存在即计费用完即删。计算选型四问CPU/GPU、集群规模、VM 规格、专用/低优先级本讲分类任务选 CPU、推荐最大节点数 3、最小节点 0 省钱。AutoML 四步选数据集 → 填实验名/目标列/集群 → 选 Classification 并 Finish30 分钟~1 小时→ 查看 Best model summary 与 Explanations。部署与消费以 Azure Container Instance 部署为 Web 服务约 20 分钟状态 Healthy 为就绪通过 Consume 选项卡的 REST 端点 api_key用本地 Python 脚本批量请求/score接口并解析返回的result数组。所有界面截图均来自原文档 5-Data-Science-In-Cloud/18-Low-Code/images/ 目录workspace-1~6 工作区创建、cluster-1~3 集群创建、dataset-1~3 数据上传、aml-1~4 AutoML、deploy-1~3 部署、consumption-1 端点消费可随文对照复现每一步操作。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考