资讯动态

Data Science for Beginners 第一课作业精解:如何用数据思维拆解真实业务场景(附示例答案与评估标准)

发布时间:2026/9/11 23:48:26 来源:尧图企业网站定制
Data Science for Beginners 第一课作业精解如何用数据思维拆解真实业务场景附示例答案与评估标准【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本文完整拆解 Data-Science-For-Beginners 课程第 1 课Defining Data Science的配套作业 ——Data Science Scenarios数据科学场景分析。作业要求学习者针对不同问题领域运用数据科学流程思考四个核心问题收集什么数据、如何收集、如何存储、能得出哪些洞见与决策。本文将结合仓库中的示例答案、课程正文与配套源码给出可直接照做的作答框架、教育场景的完整参考答案以及评判标准解读帮助初学者建立从业务问题到数据方案的完整思维链路。作业背景第一课的核心任务本作业是课程第 1 课《Defining Data Science》的第二个任务Task 2对应课程目录中的 assignment.md而 solution/assignment.md 是官方给出的参考答案其孟加拉语翻译版位于 translations/bn/1-Introduction/01-defining-data-science/solution/assignment.md。作业的前提是学习者已掌握第 1 课正文中数据旅程Data Journey的五步框架即数据获取Data Acquisition—— 收集数据数据存储Data Storage—— 决定如何存储并预判未来的查询方式数据处理Data Processing—— 将原始数据转换为可用于可视化/建模的形式可视化与人工洞见Visualization / Human Insights—— 通过图表和统计手段发现关系、检验假设训练预测模型Training a Predictive Model—— 用机器学习构建可用于新数据预测的模型。作业正是要求你把这套流程反向应用先选定一个真实问题再逐层推导出数据方案。作业要求围绕四个问题构建你的方案作业原文要求针对每个问题领域依次思考以下四个问题这也是任何数据科学项目立项时都需要回答的四大问题可以收集哪些数据Which data can you collect?如何收集这些数据How would you collect it?如何存储数据数据规模大概有多大How would you store the data? How large the data is likely to be?从这些数据中能获得哪些洞见基于数据可以做出哪些决策Which insights you might be able to get from this data? Which decisions we would be able to take based on the data?作业要求尝试思考3 个不同的问题/流程并为每个问题领域分别描述上述四点。官方给出了 3 个备选问题领域作为思考起点如何用数据改进学校中儿童的教育过程如何用数据在疫情期间控制疫苗接种如何用数据确保自己在工作中保持高效产出你可以用自己熟悉的问题领域替换这些建议题目但数量上保持至少 3 个。官方示例答案教育场景全解析官方答案以教育领域为例给出了一份完整填写其思路值得逐格拆解学习。问题领域问题收集哪些数据如何存储数据能得出哪些洞见/决策教育大学里讲座出勤率普遍偏低我们假设经常出席讲座的学生在考试中平均表现更好。我们想激励出勤并检验这个假设。通过教室安全摄像头拍摄的照片或追踪学生手机在教室内的蓝牙/Wi-Fi 地址来记录出勤考试成绩数据已经存在于大学数据库中。若使用安全摄像头照片——需要存储上课期间的几张5–10 张照片非结构化数据然后使用 AI 识别学生面部将数据转换为结构化形式。计算每名学生的平均出勤数据观察其与考试成绩之间是否存在相关性相关性的详细讨论见概率与统计章节。为激励出勤可在学校门户上发布每周出勤率榜单并在出勤率最高的学生中抽奖。逐格拆解示例答案中的思维过程问题定义Problem示例把出勤率低定义为待改善的业务问题同时提出了一个可检验的假设——出勤与考试成绩正相关。注意这里的关键词是检验假设数据科学不只是描述现状还要用统计方法验证因果关系是否存在这正是课程概率与统计章节相关性、假设检验、置信区间的用武之地。数据收集Which data / How to collect示例给出了两条互补的数据源路线摄像头照片非结构化数据需后续用 AI 人脸识别转成结构化记录蓝牙/Wi-Fi 探针追踪学生手机地址半自动的传感数据考试成绩则已在大学数据库中即复用既有数据而非重新采集。这体现了课程正文的观点数据获取不一定都是从零开始很多场景下关键数据已经存在于业务系统中。数据存储How to store示例明确区分了非结构化数据原始照片与结构化数据识别后的出勤记录并指出存储决策与后续处理方式绑定。这与课程正文中关于存储方式的三种主流选择一一对应可进一步展开为关系型数据库以表tables和模式schema组织数据用 SQL 查询。适合存储学生 ID—出勤次数—考试成绩这类强结构、强关系的记录NoSQL 数据库不强制模式适合层级化的 JSON 文档或图数据。若出勤数据要携带大量上下文如每张照片的元数据、人脸特征向量这类数据库更灵活数据湖Data Lake用于海量原始非结构化数据的分布式存储常配合 Parquet 格式与大数据的集群处理。若全校摄像头长期录制视频原始数据就可能落入这一层。关于规模估算How large示例的估算逻辑很务实——每节课只保存 5–10 张照片而不是整段视频从而把存储与算力成本控制在合理范围。作答时应给出类似的量级估计如每班每节课 10 张图 × 全校 100 个教室 × 每学期 30 节课体现成本意识。洞见与决策Insights / Decisions示例给出了观察型结论平均出勤率与成绩的相关性与行动型决策发布每周出勤榜单、对高出勤者抽奖激励两个层次。这正对应课程正文强调的actionable insights可行动的洞见数据科学的价值终点是支撑实际业务决策而非仅仅描述数据。作业输出格式按表格填写作业要求按如下表格填写列名与示例答案一致问题领域问题收集哪些数据如何存储数据能得出哪些洞见/决策教育............疫苗接种............生产效率............填写时的进阶建议每个格子都应有具体细节避免写收集学生数据这种空话而要写明数据类型结构化/非结构化、采集手段传感器/问卷/日志/摄像头、粒度每条记录代表什么与频率存储要与查询方式联动预判未来如何查询数据——是频繁按学生 ID 聚合适合关系型还是检索嵌套文档适合 NoSQL抑或对原始文件做批量分析适合数据湖——课程正文明确指出决定如何存储数据时预判未来的查询方式是有意义的洞见要区分描述与决策相关性分析、聚类等是描述而基于分析结果采取的运营动作激励、排班、干预、营销才是决策。结合课程资源做纵深拓展剩余两个领域的参考思路作业要求你自行填写疫苗接种与生产效率两格以下基于课程正文的数据来源与存储讨论给出可直接取用的素材非官方答案仅供参考疫苗接种可收集的数据包括每日接种剂数、各接种点排队时长、疫苗库存、接种者年龄段与地区分布多为结构化数据来自预约系统与库存数据库若要监测副作用或冷链温度则涉及 IoT 传感器时序数据。存储上预约与库存适合关系型数据库传感器流数据可先经缓冲端点如 IoT Hub汇入数据湖。洞见层面可发现接种速度与供应量的匹配缺口、判断哪个地区/年龄段覆盖率偏低从而决策疫苗分配优先级与增设接种点。生产效率可收集的数据包括任务完成时间、工作时段分布、会议数量与时长、产出指标如代码提交数、工单关闭数来源包括项目管理软件、日历与通信工具的日志这些多为半结构化日志。存储上可按时间段做日志库或数仓。洞见层面分析产出高峰时段、会议对连续工作时间的打断影响据此决策调整会议安排、推行深度工作时段。如需动手实践完整的数据处理链路获取 → 转换 → 关键词提取 → 可视化可运行第 1 课的 notebook.ipynb含 solution/notebook.ipynb 对照版它演示了用requests抓取文本、BeautifulSoup 清洗 HTML、RAKE 提取关键词、matplotlib/WordCloud 可视化的全过程与作业中从原始素材到结构化洞见的思路完全同构。评估标准Rubric解读官方给出的三档评估标准实质就是本次作业的自查清单优秀Exemplary合格Adequate需改进Needs Improvement对所有问题领域都能识别出合理的数据来源、存储方式以及可能的决策/洞见方案的某些方面不够详细未讨论数据存储至少描述了 2 个问题领域只描述了数据方案的零散部分仅考虑了 1 个问题领域对照自查要点覆盖数量至少 3 个问题领域合格线为 2 个数据来源合理性每个领域的数据源是否具体、可获得、与问题强相关存储方案是否被讨论这是最容易丢分的一格务必说明存储介质关系型/NoSQL/数据湖并给出规模量级洞见与决策的完整性既要能看出什么也要能决定做什么。小结本作业表面上是填一张表实际上是在训练数据科学立项最核心的能力——把模糊的业务问题翻译成数据可收集、可存储、可分析、可决策的四步方案。官方示例教育场景完整展示了提出可检验假设 → 设计非结构化/结构化混合的数据采集 → 根据处理方式选择存储 → 输出相关性发现 激励决策的双层洞见。配合课程正文的数据旅程框架、数据库与存储类型以及可视化章节你可以把这张表格填得又快又完整。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价