资讯动态

Python 如何搭建一个简单的量化数据分析流程?从 CSV 到指标计算

发布时间:2026/8/28 5:59:40 来源:尧图企业网站定制
前言在学习 Python 量化交易的过程中很多人一开始就想着策略回测自动交易但实际上一个量化系统最基础的部分往往是数据处理。如果行情数据本身存在缺失重复时间错误价格异常字段错误那么后面的策略回测即使代码完全正确也可能得到错误结果。因此一个比较完整的量化研究流程应该从数据开始。本文使用 Python 和 Pandas搭建一个简单的历史行情分析流程。一、准备一份行情数据假设 CSV 文件包含datetimeopenhighlowclosevolume例如2026-08-01,3200,3250,3180,3230,1250002026-08-02,3230,3280,3210,3260,1380002026-08-03,3260,3290,3220,3240,119000二、使用 Pandas 读取数据首先import pandas as pd读取CSVdf pd.read_csv(“market_data.csv”)查看前几行print(df.head())查看数据结构print(df.info())三、处理时间字段量化数据中时间字段非常重要。先转换df[“datetime”] pd.to_datetime(df[“datetime”])然后排序df df.sort_values(“datetime”)再重新设置索引df df.set_index(“datetime”)这样后续进行时间序列分析会方便很多。四、检查重复数据可以使用duplicates df.index.duplicated()print(duplicates.sum())如果结果大于0说明存在重复时间记录。可以进一步df df[~df.index.duplicated(keep“last”)]保留最后一条记录。五、检查缺失值使用print(df.isnull().sum())例如open 0high 0low 0close 3volume 0说明close存在3条缺失数据。不要直接忽略。需要根据数据频率和数据来源决定如何处理。六、检查价格逻辑OHLC数据应该满足基本关系High OpenHigh CloseLow OpenLow Close可以检查invalid df[(df[“high”] df[“open”]) |(df[“high”] df[“close”]) |(df[“low”] df[“open”]) |(df[“low”] df[“close”])]print(invalid)如果出现异常记录就应该进一步检查原始数据。七、计算收益率最简单的收益率df[“return”] (df[“close”].pct_change())查看print(df[[“close”, “return”]].tail())这样就得到了每个时间点的价格变化。八、计算20日移动平均线df[“ma20”] (df[“close”].rolling(20).mean())60日均线df[“ma60”] (df[“close”].rolling(60).mean())现在数据中就多出了MA20MA60九、使用均线判断趋势可以定义一个非常简单的趋势状态df[“trend”] 0df.loc[df[“ma20”] df[“ma60”],“trend”] 1df.loc[df[“ma20”] df[“ma60”],“trend”] -1含义1短期趋势偏强以及-1短期趋势偏弱十、计算波动率可以使用收益率标准差df[“volatility”] (df[“return”].rolling(20).std())这样可以观察最近20个周期的价格波动情况。十一、计算成交量变化例如计算20周期平均成交量df[“volume_ma20”] (df[“volume”].rolling(20).mean())再计算成交量比df[“volume_ratio”] (df[“volume”] /df[“volume_ma20”])如果volume_ratio 1说明当前成交量高于近期平均水平。十二、建立一个简单的研究信号现在假设我们研究一个非常简单的趋势条件MA20 MA60并且成交量 20周期平均成交量Pythondf[“signal”] ((df[“ma20”] df[“ma60”])(df[“volume”] df[“volume_ma20”]))得到TrueFalse这样的信号。注意这只是一个研究示例并不代表一个完整交易策略。十三、为什么信号和交易执行应该分开这是量化系统设计中非常重要的一点。不要把所有逻辑写在一个函数里。例如数据模块↓指标模块↓信号模块↓交易模块↓风险控制↓回测模块这样以后修改策略时不需要把整个程序推倒重来。十四、把数据处理封装成函数例如def prepare_data(path):df pd.read_csv(path) df[datetime] pd.to_datetime( df[datetime] ) df df.sort_values( datetime ) df df.set_index( datetime ) df[return] ( df[close] .pct_change() ) df[ma20] ( df[close] .rolling(20) .mean() ) df[ma60] ( df[close] .rolling(60) .mean() ) return df使用df prepare_data(“market_data.csv”)print(df.tail())以后换数据文件只需要修改路径。十五、数据处理完成后再进入回测比较合理的研究流程原始行情数据↓数据清洗↓数据验证↓指标计算↓信号生成↓回测↓资金曲线↓风险指标而不是CSV↓直接买卖十六、为什么数据质量比策略复杂度更重要假设一个策略只有两条均线但是数据非常准确。另一个策略使用20个指标但是行情数据存在缺失重复未来数据时间错位那么后者即使回测收益看起来非常漂亮也没有太大意义。因此量化研究中经常需要遵循先保证数据正确再讨论策略效果。十七、进一步加入数据质量检查以后可以建立一个统一的数据检查函数def validate_data(df):errors [] if df.empty: errors.append( 数据为空 ) if df.index.duplicated().any(): errors.append( 存在重复时间 ) if df[close].isnull().any(): errors.append( 存在缺失收盘价 ) if ( df[high] df[low] ).any(): errors.append( 存在High Low ) return errors调用errors validate_data(df)if errors:print(“数据存在问题”)for error in errors: print(error)else:print(“数据检查通过”)这样以后建立自动化数据仓库时就可以把数据检查作为固定步骤。十八、从简单脚本逐渐发展成量化研究系统一个小型 Python 量化项目最终可以逐渐变成quant_project/│├── data/│ ├── raw/│ └── processed/│├── indicators/│├── strategies/│├── backtest/│├── risk/│├── reports/│└── main.py这样比把所有代码全部放到main.py里面更加容易维护。十九、AI 也可以加入这个流程如果以后结合上一篇文章中的 AI Agent可以形成用户↓AI Agent↓读取行情数据↓Python数据清洗↓计算指标↓执行策略分析↓生成研究报告例如“帮我分析RB最近一个月的趋势。”Agent可以自动调用读取数据↓计算MA↓计算波动率↓分析成交量↓生成报告这就是AI Python 量化数据分析比较适合进一步开发的方向。总结一个完整的 Python 量化研究流程并不是从“写买卖策略”开始。更加合理的顺序是获取数据↓清洗数据↓验证数据↓计算指标↓生成信号↓回测↓分析资金曲线↓评估风险其中最基础、也最容易被忽略的就是数据质量。只有确保数据可靠后面的策略收益、最大回撤、Sharpe 等指标才有研究价值。如果后面再结合 AI Agent还可以进一步把数据获取指标计算策略分析报告生成整合成一个自动化的 AI 量化研究助手。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价