随着大数据时代的到来,结构化数据分析需求日益增长,但传统可视化工具对用户专业能力要求高、操作繁琐,存在明显的使用门槛。本文设计并实现了一套基于AIGC的结构化数据可视化自动生成系统。系统采用Flask后端框架与Vue3前端技术栈,集成大语言模型与规则引擎双路径图表生成机制,支持用户通过自然语言指令生成多种ECharts图表。系统实现了交互式选区捕获与上下文理解、个性化偏好学习、图表数据双向联动、专业统计分析集成以及数据溯源等核心功能。用户可在数据表格中灵活选择数据,系统自动分析选区特征并生成主动建议;图表悬停高亮对应数据行、点击图表元素可下钻查看原始记录;临时框选数据可驱动主图实时预览。系统同时提供联动看板与数据溯源功能,确保分析过程可解释、可追溯。实验结果表明,该系统有效降低了数据分析门槛,提升了可视化分析效率,为结构化数据的智能探索提供了可行方案。
1.1 研究背景
在数字化浪潮席卷各行各业的今天,数据已成为重要的生产要素。企业决策、学术研究、政府治理等各个领域都高度依赖对数据的分析和理解。然而,海量的结构化数据本身是枯燥且难以直接解读的,将数据转化为直观、易懂的图表,是数据价值释放的关键一步。传统的数据可视化工具,如Excel、Tableau、Power BI等,虽然功能强大,但往往要求用户具备一定的数据处理能力和图表设计经验。用户需要手动选择数据范围、确定图表类型、配置坐标轴、调整样式细节,整个过程繁琐且耗时。对于非专业用户而言,从原始数据到洞察结论之间存在明显的认知鸿沟。
近年来,人工智能生成内容技术取得了突破性进展,特别是在自然语言处理和代码生成领域展现出了强大的能力。大语言模型的出现为“用自然语言驱动计算机完成任务”提供了可能。将AIGC技术应用于数据分析领域,让用户通过简单的语言描述即可生成专业的图表,已成为一个极具潜力的研究方向。这不仅能极大降低数据可视化的门槛,还能将用户的注意力从操作细节转移到数据洞察本身,提升分析效率。
与此同时,数据分析过程中用户的交互行为本身蕴含着丰富的语义信息。用户在数据表格中进行的每一次框选、点选,都代表了其对特定数据子集的关注。传统的分析工具往往将这种选区行为视为独立的操作,未能将其与后续的图表生成、统计分析进行有效融合。如何让系统理解用户选区的特殊意义,并将其作为上下文信息指导后续的智能分析,是提升人机协作深度的重要课题。
1.2研究目的及意义
本研究旨在设计并实现一套基于AIGC的结构化数据可视化自动生成系统,通过融合大语言模型的自然语言理解能力与交互式选区的上下文感知能力,构建一个以用户选区为核心驱动的智能分析闭环系统。具体研究目的包括:
第一,探索自然语言指令与结构化数据交互的结合方式。通过将用户的语言描述与当前选区信息、数据集字段特征进行融合,使系统能够准确理解用户意图,自动生成符合ECharts规范的图表配置。第二,研究选区驱动的交互分析范式。系统需要支持用户在表格中进行灵活的框选、点选操作,自动分析选区的统计特征、排名位置、异常属性,并将这些上下文信息注入图表生成提示词,使AI生成的图表能够体现选区的特殊意义。第三,构建图表与数据的双向联动机制。实现图表元素到原始数据行的映射,支持悬停高亮、点击下钻等交互,同时实现选区变化驱动图表实时更新,形成所见即所选、所选即所绘的流畅体验。第四,建立完整的数据溯源链路。每张图表都应记录其数据来源、参与字段、清洗规则等信息,用户可以追溯图表背后的原始数据,确保分析结果的可解释性和可信度。
本研究的意义在于,通过将AIGC技术与交互式数据分析相结合,为结构化数据的智能探索提供了一种新的范式。系统能够有效降低数据分析的技术门槛,让非专业用户也能通过自然语言对话的方式完成复杂的数据可视化任务。同时,选区驱动的设计理念强化了人与数据的协作关系,系统不再是被动执行指令的工具,而是能够主动感知用户关注点并提供上下文相关建议的智能助手。这对于推动数据分析工具的智能化、平民化发展具有重要的理论和实践价值。
5.1用户认证与系统登录
系统登录页面如图5-1所示,用户需要输入用户名和密码进行身份验证。页面左侧通过三大功能卡片展示了系统的核心特性:自然语言生成图表、选区驱动分析闭环、看板联动与数据溯源,帮助新用户快速了解系统能力。登录成功后,系统返回包含用户信息的认证令牌,前端将其存储于本地,后续请求携带该令牌完成身份校验,确保不同用户的数据相互隔离。
图5-1 系统登录界面
5.2数据接入功能实现
数据接入是用户使用系统的第一步,提供了文件上传和演示数据生成两种方式。数据资源管理器页面如图5-2所示,左侧面板包含上传文件入口、主题快速生成按钮以及用户已创建的数据集列表。用户可通过“选择文件”按钮上传本地的CSV或Excel文件,系统自动解析并展示预览。主题快速生成区域提供销售经营分析、学生成绩分析、平台运营分析三套演示数据,用户点击即可一键生成示例数据集。右侧区域展示当前数据集的详细信息,包括字段摘要、清洗摘要以及分页数据预览表格,用户可通过底部分页控件浏览全量数据。
图5-2 数据资源管理器页面
当用户点击“销售经营分析”主题按钮后,系统自动生成销售主题演示数据集,其预览界面如图5-3所示。该数据集包含订单月份、区域、城市、渠道、产品类别、销售额、成本、利润等字段,涵盖订单ID、客户满意度、是否退货等指标。预览表格展示前20行数据,用户可通过分页浏览所有记录。字段摘要区域自动推断各字段类型并展示唯一值数量,清洗摘要区域记录缺失值处理与异常值识别规则,让用户了解数据预处理过程。
图5-3 销售主题数据集预览页面
5.3 选区分析与历史功能实现
分析工作区是系统交互的核心页面,如图5-4所示。页面顶部显示当前激活的数据集信息,主画布区域用于展示生成的图表,右侧为选区摘要面板和对话式图表助手。数据表格支持Ctrl点选、Shift范围选、鼠标框选等多种选区方式,选中的行和列会高亮显示,选区摘要面板实时更新选中行数、列数以及数值字段的均值、最值等统计信息。用户可为当前选区命名并保存至历史选区列表,系统自动分析选区的上下文特征,包括在整体数据中的占比、排名位置、异常特征等,并生成主动分析建议。选区历史列表支持选区恢复、重命名、删除和对比,帮助用户追踪分析路径。
图5-4 分析工作区界面
对话式图表助手集成在分析工作区右侧,如图5-5所示。用户可在输入框中输入自然语言指令,如“生成按地区销售额柱状图”或“把这个图改成黄色”。系统将当前选区上下文、数据集字段信息、用户偏好画像和对话历史融合构建结构化提示词,调用大语言模型生成ECharts配置并实时渲染于主画布。若LLM服务不可用,系统自动降级至规则引擎,基于数据特征和指令关键词生成基础图表。生成图表后,助手回复会展示图表标题、类型及生成理由,并提示用户可继续修改图表。图表修改功能支持通过自然语言调整标题、类型、颜色等属性,修改结果即时生效。
图5-5分析工作区选区交互界面
5.4联动看板功能实现
联动看板页面如图5-6所示,该页面集中展示当前数据集下用户生成的所有图表,并支持多图表间的协同联动筛选。页面顶部展示看板图表总数、当前筛选命中的行数以及当前数据集名称。联动筛选条位于左侧,用户可选择筛选字段、输入筛选值并设置排序方式,点击“刷新联动看板”按钮后,所有图表根据筛选条件同步更新。看板中的每张图表卡片均提供“查看溯源”和“删除图表”按钮,方便用户管理图表。右侧联动摘要面板实时展示当前看板的图表列表、联动概况及当前生效的筛选条件。
图5-6联动看板首页
当用户在联动筛选条中选择筛选字段为“region”、筛选值为“华东”并点击刷新后,看板中的图表会根据筛选条件重新生成,如图5-7所示。图表中仅展示华东地区的数据分布,右侧联动摘要面板的“当前筛选”区域同步更新为“region: 华东”,“命中行数”显示为符合条件的记录数。点击看板中的任意图表元素,同样可以触发全局联动刷新,所有图表根据该元素的筛选条件同步更新,实现图表间的交叉筛选与探索。
图5-7联动筛选后看板效果
5.5数据溯源与偏好学习功能实现
用户偏好画像页面如图5-8所示,该页面允许用户查看和修改个性化偏好设置,并展示系统自动推断的偏好特征。左侧为偏好画像编辑区域,用户可设置主题、字体、偏好图表类型、常用分析路径以及风格提示词,点击“保存偏好”后系统更新用户偏好记录。右侧为画像摘要区域,展示系统基于用户历史图表生成行为自动推断的结果。其中“自动推断偏好”以自然语言形式总结用户的偏好特征,如“最近偏好图表类型偏向 line, bar, dual_axis;高频风格关键词包括黄色、绿色、科技蓝、浅色”。“自动推断风格关键词”以标签形式展示系统识别出的高频视觉风格词汇,“自动推断分析意图”展示用户常用的分析目的词汇,“最近图表偏好”和“最近模板”则记录用户最近使用的图表类型和分析指令。这些推断结果会被注入图表生成提示词,引导大语言模型生成符合用户习惯的图表样式和分析方式。
图5-8用户偏好画像页面