ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

ChatGPT AutoExpert 之 Data Analysis GPT 系统提示词全解:数据分析智能体的角色设计与实战用法

2026/10/8 1:52:54 拓冰建站 浏览量
ChatGPT AutoExpert 之 Data Analysis GPT 系统提示词全解:数据分析智能体的角色设计与实战用法 提示工程AI 应用AI Agent【免费下载链接】ChatGPT-AutoExpert Supercharged Custom Instructions for ChatGPT (non-coding) and ChatGPT Advanced Data Analysis (coding).项目地址https://gitcode.com/gh_mirrors/ch/ChatGPT-AutoExpert点击查看免费下载本篇技术指南以 ChatGPT AutoExpert 开源仓库README.md中提取的 Data Analysis 自定义 GPT 系统提示词为绝对核心逐段拆解其角色定位、行为准则、Python 工具调用策略与隐私边界并结合仓库内 Advanced Data Analysis 底层系统提示词、开发者版自定义指令等源码级资料进行纵深印证。读完本文你将完整掌握该提示词的设计意图、每条指令的底层落地机制以及如何在 ChatGPT 中复现并运行一个以 Python 为引擎、以统计分析与可视化为核心的 Data Analysis GPT。一、Data Analysis GPT 在 AutoExpert 生态中的定位ChatGPT AutoExpert 是一套旨在提升 GPT-4 / GPT-3.5 对话模型响应深度与准确度的自定义指令集合其仓库结构将提示词按用途划分为多个目录standard-edition/面向非编码类日常问答的标准版自定义指令developer-edition/面向编码任务、需要 GPT-4 与Advanced Data Analysis的开发者版_system-prompts/gpts/从 ChatGPT 官方Custom GPTs中提取的系列系统提示词其中就包括本文主角 data_analysis.md。根据 Custom GPTs 总览 README 的登记表官方商店中的 Data Analysis GPT 描述为Drop in any files and I can help analyze and visualize your data拖入任意文件即可帮你分析与可视化数据其启用的工具仅为python——没有浏览器、没有 DALL·E。这决定了该 GPT 是一个纯计算引擎型智能体一切能力都建立在代码执行之上。值得注意的前提官方 Custom GPTs 使用独立的gpt-4-gizmo模型拥有独立的用量限制且所有 Custom GPT 共享该限额上下文大小为 32k见 _system-prompts/gpts/README.md。理解这一约束有助于我们在设计分析任务时控制数据规模与上下文占用。二、核心角色定义数据集解释与分析助手原提示词的第一段明确了该 GPT 的首要职能As a Data Analysis GPT, your primary function is to assist users in interpreting and analyzing complex data sets. You should respond to queries with clear, concise, and informative explanations.可以提炼出四个关键词它们构成了整个提示词的行为地基Interpret解释不止于计算结果还要把数据的业务含义讲清楚Analyze分析主动执行统计检验、模式识别等分析动作Clear Concise清晰简洁回复要信息密度高、不绕弯与 AutoExpert 一贯的减少免责声明与废话Minimized Hand-Holding见 README.md理念一脉相承Informative有信息量每条回复都要交付实质结论而非空泛描述。当用户以原始数据或描述性摘要descriptive summary两种形式提供数据时该 GPT 都应启动自身能力执行统计分析statistical analyses、生成可视化visualizations、给出洞见insights。同时它被要求理解各种数据格式various data formats、识别显著模式identify significant patterns并基于实证证据给出结论offer conclusions based on empirical evidence——这是数据驱动而非直觉驱动的直接指令化表达。从源码印证数据格式能力的底层支撑理解各种数据格式并非空话其技术底座来自 ChatGPT 后端的工具链。在 _system-prompts/all_tools.md 中可以找到myfiles_browser工具search(query: str)对当前会话上传的文件执行检索并显示结果open_url(url: str)按文档 ID通常为 UUID打开文档click(id: str)、back()、scroll(amt: int)、quote_lines(start, end)定位、回溯、滚动与按行引用。也就是说用户上传的 CSV、Excel、JSON 等文件会先进入文件浏览器环节GPT 通过检索与打开文档来完成格式识别与内容抽取再交由 python 工具做真正的计算。建议在实际使用中面对超大文件先让 GPT 用search定位关键列与抽样行再决定是否全量读入以规避 32k 上下文与 60 秒执行超时的双重限制。三、响应准则准确性优先与澄清机制原提示词第二段写道In your responses, prioritize accuracy and relevance. When necessary, you may ask clarifying questions to ensure that your analyses meet the users needs. You should maintain a professional tone and refrain from providing personal opinions or advice outside the scope of data analysis.这里包含三条相互咬合的准则准确性优先prioritize accuracy结论必须可复核、可溯源杜绝臆测澄清前置clarifying questions当分析目标模糊时允许反问。例如这份销售数据想比较的是月度同比还是环比异常值是否需要剔除剔除标准是什么这类问题能显著提升后续分析的命中率角色边界scope discipline保持专业语气不越界提供个人意见。数据分析 GPT 只回答数据怎么说不代替用户做商业决策。这一必要时提问、但不过度打扰的设计与 AutoExpert 开发者版中Unless youre only answering a quick question…的响应节奏见 developer-edition/chatgpt__custom_instructions.md是同构的提问是手段交付高质量分析才是目的。四、Python 工具策略复杂任务的代码执行通道原提示词第三段是该 GPT 的能力开关For tasks that involve extensive data, such as creating visualizations or running complex statistical models, you should utilize the Python tool to execute code. Remember to present your findings in a way that is understandable to users regardless of their statistical background.要点有三触发条件涉及大量数据、需要绘图、或需要跑复杂统计模型时必须调用 python 工具执行代码而不是口头描述应该怎么做呈现方式无论用户的统计学背景如何都要把结果翻译成可理解的语言——代码是内部引擎自然语言才是交付界面隐含边界并非所有任务都要开 Jupyter简单计算可以走推理完成这与开发者版Unless running a command, dont use Jupyterdeveloper-edition/chatgpt__about_me.md的分流策略一致。4.1 python 工具的运行环境源码实证该 GPT 使用的 python 工具其底层环境在 _system-prompts/advanced-data-analysis.md 中有精确描述When you send a message containing Python code to python, it will be executed in a stateful Jupyter notebook environment. python will respond with the output of the execution or time out after 60.0 seconds. The drive at /mnt/data can be used to save and persist user files. Internet access for this session is disabled.据此可确认以下运行事实这些是 ChatGPT Advanced Data Analysis 沙箱的公开约束写入系统提示词特性说明执行环境有状态statefulJupyter notebook跨代码单元格保留变量单次超时60.0 秒超时返回超时提示持久化存储/mnt/data目录可保存并跨会话持久化用户文件网络访问禁用禁止外部 web 请求与 API 调用会失败Python 版本3.8运行在 x86_64 架构 VM 上见 developer-edition/README.md对分析任务的直接启示分步执行60 秒超时意味着大数据集应分块处理、分步建模而非一次性跑完整个 pipeline善用 /mnt/data中间结果清洗后的 DataFrame、生成的图表文件先落盘再在后续单元格读取既能绕开上下文限制也为跨轮次分析保留状态离线分析不要指望在分析过程中联网抓取外部数据一切数据来源只能是用户上传的文件版本兼容代码应面向 Python 3.8 编写注意pandas、matplotlib等库在该版本下的 API 兼容性。4.2 数据分析的标准动作组合结合原提示词与沙箱约束一个规范的数据分析会话应包含以下动作序列文件接收与格式识别用myfiles_browser的search/open_url打开上传文件识别格式CSV、Excel、JSON 等与结构列名、类型、缺失值探索性分析EDA在 python 中执行df.head()、df.describe()、df.info()等生成描述性统计摘要统计建模按需运行相关性分析、回归、假设检验等可视化用matplotlib/seaborn绘图并把图表保存到/mnt/data供用户下载查看结论呈现用非技术语言总结发现、给出基于实证证据的结论并说明数据局限。五、隐私与伦理边界个人数据的处理红线原提示词第四段给出了数据安全守则You should not perform any actions that involve personal data unless explicitly provided by the user for analysis within the current session. Respect privacy and confidentiality at all times. If a task cannot be completed due to ethical concerns or data limitations, you must communicate this clearly to the user.逐条拆解会话内使用原则个人数据仅限用户在当前会话内明确提供、用于当次分析的场景不得挪作他用全程保密任何时候都要尊重隐私与机密性不重复利用历史会话中的敏感数据显式沟通因伦理问题或数据条件不足如样本量太小、字段缺失而无法完成任务时必须如实告知用户而不是硬凑结论。这条准则与 AutoExpert 项目减少免责声明但保留必要边界的取向一致不滥用合规话术堆砌篇幅但在真正的红线个人数据面前绝不含糊。六、教育角色授人以渔的分析教练原提示词最后一段定义了 GPT 的长期价值Lastly, you are to assist users in learning more about data analysis by providing explanations of concepts and methods when asked. This educational role is crucial as it empowers users to better understand and engage with their own data analysis tasks in the future.这意味着 Data Analysis GPT 的职责不仅是替用户算还要在用户询问时解释概念层面什么是 p 值、置信区间、中心极限定理方法层面为什么选线性回归而不是决策树、缺失值填充有哪些策略及各自适用场景实践层面教会用户读懂自己得到的图表与统计输出。这种解释 交付的双通道设计与仓库中开发者版的 Preamble/Epilogue 机制每次响应开头声明语言、专家角色、需求与计划结尾总结 History / Source Tree / Next Task见 developer-edition/README.md异曲同工都是在提升单次回答质量之外帮助用户建立对分析过程本身的掌控感。七、实战配置如何将本提示词部署为可用的 Data Analysis GPT原文档本质上是可直接粘贴的系统提示词配合 ChatGPT 的 Custom GPTs 功能即可落地。部署步骤如下进入 GPT Builder在 ChatGPT 界面选择Explore GPTs→Create进入自定义 GPT 编辑页粘贴指令将 _system-prompts/gpts/data_analysis.md 的完整文本粘贴到 Instructions行为上下文区域开启工具在 Capabilities 中启用Code Interpreter / Advanced Data Analysis对应仓库中的 python 工具无需开启 Browsing 与 DALL·E配置交互信息按 _system-prompts/gpts/README.md 中官方 Data Analysis GPT 的样子设置名称Data Analysis、简介Drop in any files and I can help analyze and visualize your data并填写 welcome message 与几个起始提问prompt starters例如帮我分析这份销售数据的月度趋势这个 CSV 里哪些特征与目标变量相关性最强为这份数据生成直方图与箱线图解释一下这份回归结果中每个系数的含义7.1 进阶与开发者版 verbosity 机制的配合若你同时使用 AutoExpert 开发者版developer-edition/可让数据分析代码的详细度完全可控开发者版支持V[0-3]前缀调节代码风格V0 极简 code golfV2 简单为默认V3 冗长且注重 DRY见 developer-edition/README.md。典型用法V1用 pandas 读取这个 Excel统计每列缺失率—— 得到精简、无冗余的高效代码V3对数据进行完整的探索性分析并可视化—— 得到模块化、带注释的完整 pipeline。7.2 版本选择提醒如果你需要的是聊天 编码一体的增强体验仓库还提供两条路径标准版standard-edition/面向非编码任务含自动改写问题、斜杠命令、框架自动选择等能力开发者版developer-edition/需 ChatGPT Pro 订阅GPT-4 Advanced Data Analysis附带 autodev.py 配套脚本支持/memory会话记忆打包、自定义 wheel 安装、文件/符号树维护等。本文所讲的 Data Analysis GPT 提示词则是开箱即用、专注分析的轻量方案适合不想引入完整开发者版、只需一个专职数据分析助手的场景。八、小结九行提示词背后的设计哲学回看 _system-prompts/gpts/data_analysis.md 全文——它仅九行英文却完成了五层行为设计层级原文要点落地机制角色解释与分析复杂数据集清晰、简洁、有信息量的回复格式能力统计分析、可视化、洞见调用 python 工具Jupyter 沙箱执行质量控制准确性优先、必要时澄清反问前置、专业语气、边界内不越权合规个人数据会话内使用、隐私保密伦理/数据不足时显式沟通增值教育角色应询解释概念与方法这五层设计彼此咬合角色定义能力范围能力由工具承载工具受环境约束60 秒超时、无网络、/mnt/data 持久化约束倒逼出分步执行与落盘策略而教育角色则让每一次分析都沉淀为用户的可迁移技能。对于任何想打造数据分析型智能体的开发者或提示词工程师这份提示词都是一份结构精炼、可直接复用的范本。延伸阅读仓库内Data Analysis GPT 原始系统提示词Custom GPTs 总览与工具配置表Advanced Data Analysis 底层系统提示词python 工具环境约束全量工具说明含 myfiles_browser 文件浏览机制开发者版使用手册verbosity、斜杠命令、安装流程开发者版自定义指令全文Preamble / Epilogue 模板开发者版 about_mewheels 安装与 Jupyter 使用策略标准版自定义指令V1~5 详细度分级参考赞分享提示工程AI 应用AI Agent【免费下载链接】ChatGPT-AutoExpert Supercharged Custom Instructions for ChatGPT (non-coding) and ChatGPT Advanced Data Analysis (coding).项目地址https://gitcode.com/gh_mirrors/ch/ChatGPT-AutoExpert点击查看免费下载相关推荐The Rizz Game GPT 提示词架构解析随机化角色扮演与难度分级的系统化设计The Rizz Game GPT 提示词架构解析随机化角色扮演与难度分级的系统化设计 The Rizz Game 是一个以尝试要到她的电话号码为目标的对提示工程Screenplay GPT 提示词深度解析Script Smith 编剧创作系统的设计原理与实战用法Screenplay GPT 提示词深度解析Script Smith 编剧创作系统的设计原理与实战用法 本文基于 GPTs 仓库 README.md htt提示工程Professor Synapse 提示词框架深度解析用 Synapse_CoR 编排多专家智能体的 GPT 系统设计Professor Synapse 提示词框架深度解析用 Synapse_CoR 编排多专家智能体的 GPT 系统设计 本仓库 GPTs https://l提示工程上一篇psutil 文档站构建工程指南基于 Sphinx、ablog 与 GitHub Pages 的自托管文档体系下一篇OpenEuler Sw Committee工作流程详解从议题提出到决策执行创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考