资讯动态

数据科学上云入门:Data-Science-For-Beginners 云上数据科学系列第一课

发布时间:2026/9/12 8:22:28 来源:尧图企业网站定制
数据科学上云入门Data-Science-For-Beginners 云上数据科学系列第一课【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners云计算正在重塑数据科学的工作方式从海量数据存储、数据集成、大规模计算到机器学习模型训练与部署几乎每一个环节都能在云上完成。本篇文章围绕 Data-Science-For-Beginners 课程体系中数据科学与云Data Science in the Cloud模块的第一课展开系统讲解云与云计算的基本概念、公有云/私有云/混合云的区别、IaaS/PaaS/SaaS 三大服务模型以及数据科学家为何选择云来运行数据科学项目并剖析两个真实的云上数据科学项目案例。读完本文你将掌握云上数据科学的基础知识框架为后续学习低代码/无代码训练模型第 18 课与 Azure ML SDK 开发方式第 19 课打下坚实基础。什么是云The Cloud云即云计算Cloud Computing是通过互联网按需交付、按使用付费pay-as-you-go的计算服务这些服务托管在云基础设施之上。服务范围覆盖存储、数据库、网络、软件、分析以及智能服务等解决方案。换句话说你不再需要自建机房、购买物理服务器而是通过网络租用弹性计算资源按实际用量计费。对应课程模块总览请参阅 5-Data-Science-In-Cloud/README.md其中明确指出处理大数据时云可能成为改变游戏规则的关键因素。公有云、私有云与混合云按部署模型云通常分为三类课程中给出了如下定义公有云Public Cloud由第三方云服务提供商拥有并运营通过互联网向公众交付其计算资源。这是最常见的形态用户按需租用资源、按用量付费。私有云Private Cloud云计算资源仅被单一企业或组织独占使用服务与基础设施在私有网络上维护安全性和可控性更高但需要自行投入建设和维护成本。混合云Hybrid Cloud结合公有云与私有云的系统。用户可以选择在本地on-premises数据中心运行部分业务同时允许数据和应用程序运行在一个或多个公有云上兼顾安全合规与弹性扩展。IaaS、PaaS 与 SaaS 三大服务模型大多数云服务可归入以下三类基础设施即服务IaaSInfrastructure as a Service用户租用 IT 基础设施例如服务器和虚拟机VM、存储、网络、操作系统。用户自行管理操作系统之上的环境云提供商负责底层硬件。平台即服务PaaSPlatform as a Service用户租用用于开发、测试、交付和管理软件应用的环境。用户无需关心开发所需的底层基础设施服务器、存储、网络、数据库的搭建与管理可专注于应用代码本身。软件即服务SaaSSoftware as a Service用户通过互联网按需访问软件应用通常以订阅方式计费。用户无需关心软件应用的托管、底层基础设施以及维护工作如软件升级和安全补丁开箱即用。课程指出目前最大的几家云服务提供商包括 Amazon Web ServicesAWS、Google Cloud PlatformGCP和 Microsoft Azure。它们各自提供覆盖 IaaS、PaaS、SaaS 的完整服务目录数据科学家可以按项目需求自由组合。为什么数据科学要选择云开发者和 IT 专业人员选择使用云的原因多种多样课程总结了七大核心驱动力驱动力说明创新Innovation将云提供商创建的创新服务直接集成到你的应用中快速增强应用能力。灵活性Flexibility只为你需要的服务付费可以从广泛的服务目录中自由选择通常按用量计费并能随需求变化调整服务组合。预算Budget无需前期投入购买硬件与软件也无需搭建和运营本地数据中心只需为实际使用量付费把资本支出转化为运营支出。可扩展性Scalability资源可以根据项目需求伸缩应用随时可增减计算能力、存储和带宽以适应外部因素如流量高峰的变化。生产力Productivity将数据中心运维等可外包的任务交给云厂商让你专注于业务本身。可靠性Reliability云提供多种持续备份数据的方式可制定灾难恢复disaster recovery计划确保危机时期业务与服务不中断。安全性Security借助云提供商提供的策略、技术与控制手段强化项目整体安全水平。云如何解决数据科学家的具体难题理解云的普遍价值之后课程进一步聚焦数据科学家和数据开发者的实际工作场景给出了五类典型的云应用需求存储海量数据与其购买、管理和保护大型服务器不如把数据直接存放在云中例如 Azure Cosmos DB、Azure SQL Database 和 Azure Data Lake Storage。执行数据集成Data Integration数据集成是数据科学从收集数据迈向采取行动的关键环节。借助云上的数据集成服务如 Azure Data Factory可以把来自不同来源的数据收集、转换并整合到统一的数据仓库中。数据处理Data Processing处理海量数据需要大量算力并非每个人都有足够的本地机器。直接利用云上强大的计算能力来运行和部署解决方案是很多团队的选择。使用数据分析服务Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks 等服务可帮助把原始数据转化为可执行洞察actionable insights。使用机器学习与数据智能服务无需从零开始可以直接使用云厂商提供的机器学习算法如 AzureML还可以使用语音转文字、文字转语音、计算机视觉等认知服务。课程模块 5-Data-Science-In-Cloud/README.md 展示了这一系列课的完整技术路线以心力衰竭Heart Failure临床数据集为素材分别用纯界面操作的低代码/无代码方式18-Low-Code和Azure ML SDK 方式19-Azure完成模型的训练、部署与消费云正是这两条路径共同的运行底座。云上数据科学实战案例为了让概念落地课程给出了两个完整的云上数据科学项目案例。案例一社交媒体实时情感分析这是一个机器学习入门者常研究的场景社交媒体实时情感分析。设想你运营一个新闻媒体网站想利用实时数据了解读者对哪些内容感兴趣可以构建一个程序对 Twitter 上与你读者主题相关的推文执行实时情感分析。需要关注的关键指标有两个特定主题hashtag的推文量衡量话题热度的体积指标情感倾向sentiment通过分析工具对指定主题的推文内容进行情感判定。该项目的完整实施步骤为创建事件中心Event Hub作为流式输入负责从 Twitter 收集数据配置并启动 Twitter 客户端应用用于调用 Twitter Streaming APIs创建 Stream Analytics 作业job指定作业输入与查询query创建输出接收器output sink并指定作业输出启动作业。整体技术栈体现了云上实时流处理的经典范式流数据入口Event Hub→ 流式计算引擎Stream Analytics→ 结构化输出输出接收器全部环节由云服务托管无需自建消息队列与流处理集群。案例二科学论文分析第二个案例来自本课程体系的作者之一 Dmitry Soshnikov。他构建了一个分析 COVID 论文的工具能够从海量科学论文中提取知识、获得洞察帮助研究人员高效地在大型论文集合中导航。其技术步骤如下信息提取与预处理使用 Text Analytics for Health健康文本分析服务从论文中抽取并预处理医学信息并行化处理使用 Azure ML 将处理过程并行化大幅缩短批量分析耗时存储与查询使用 Cosmos DB 存储和查询提取出的信息支撑灵活的检索需求交互式可视化使用 Power BI 创建交互式仪表盘用于数据探索与可视化。这两个案例分别展示了云在实时流数据与大规模批处理文本两类场景中的价值前者依赖事件中心与流分析服务后者依赖托管机器学习平台、NoSQL 数据库与 BI 可视化工具——它们共同印证了课程结论云服务可以以多种方式支撑数据科学工作流。课程配套练习市场调研作业本课配套有一个市场调研Market Research作业见 17-Introduction/assignment.md课程已介绍多家重要的云服务提供商作业要求你针对这些厂商开展市场调研对比它们各自能为数据科学家提供什么能力评估各家服务是否具有可比性并撰写一篇论文介绍至少三家云厂商的数据科学服务及其差异。评分标准Rubric如下卓越Exemplary合格Adequate待改进Needs Improvement一页论文描述三家云厂商的数据科学服务并区分它们之间的差异呈现了篇幅较短的论文提交了论文但未完成分析建议调研时从三个维度切入各家平台的机器学习平台训练/部署能力、数据存储与计算服务数据湖、数据仓库、批处理/流处理、认知与预训练服务视觉、语音、NLP并落到可量化的差异如计费模式、伸缩上限、生态集成这与本课正文中存储、集成、处理、分析、机器学习五类需求的分析框架一脉相承。从入门到实操本课在课程体系中的位置本课是 5-Data-Science-In-Cloud 模块共 3 课的第一课定位为概念铺垫。后续两课将把本课的云概念落到真实项目第 18 课低代码/无代码方式在 Azure ML Studio 中通过图形界面完成工作区创建、计算资源计算实例/计算集群配置、数据集上传以及 AutoML 自动训练全程无需编写代码适合快速验证项目可行性和构建概念验证POC。第 19 课Azure ML SDK 方式使用 Python SDK 以代码方式完成相同的流程包括Workspace.from_config()加载工作区、Experiment管理实验、AmlCompute创建计算集群、AutoMLConfig配置自动机器学习以及模型注册、AciWebservice部署与 REST 端点消费。两课对照使用同一个心力衰竭预测数据集来自 Kaggle13 列、299 行其对比表格清晰说明了两种方式的取舍低代码方式对代码能力无要求、开发快速但不适合生产环境SDK 方式需要编程能力但可以实现从资源创建到模型部署的全流程自动化具备生产就绪能力。这正是本课所讲云上存储、算力、机器学习服务概念的最佳落地注脚——理解云的基础概念是走进这些实操路径的前提。小结本课围绕为什么数据科学要上云这一核心问题完成了三层递进的论述第一层回答云是什么定义、三种部署模型、三大服务模型第二层回答为什么选云七大优势与五类数据科学场景第三层用两个真实案例证明云能做什么实时情感分析、科学论文分析。作为云上数据科学系列的开篇它没有涉及任何代码而是为后续基于 Azure 的低代码与 SDK 实战建立起必要的概念框架。对初学者而言建议先通过本课的课后小测验检验概念掌握情况再完成市场调研作业最后进入第 18、19 课的动手环节形成概念 → 对比 → 实操的完整学习闭环。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价