有团队问过一个很实际的问题:想用大模型帮体育品牌做ESG分析,第一步到底要准备哪些数据?答案不是"越多越好",而是要先弄清楚体育ESG覆盖的几个维度,各自需要哪类原始输入,模型才有东西可以处理,而不是对着一堆零散表格无从下手。

环境类数据:碳、能源、材料

环境维度是大多数人最先想到的部分,但具体拆开来至少有三块输入。碳排放数据需要区分Scope 1(场馆自有锅炉、发电机等直接排放)、Scope 2(外购电力)、Scope 3(供应链运输、观众出行等间接排放),三类数据来源完全不同,混在一起算很容易失真。能源数据来自场馆的电表、空调和照明系统,理想情况下要按比赛日和非比赛日分开记录,因为两者用能强度差别很大。材料数据则来自产品设计和采购部门,包括原材料种类、再生材料占比、供应商提供的材料成分说明。

社会类数据:供应商、员工、志愿者、社区、公益

社会维度的数据分散在更多部门里。供应商数据包括合规审核记录、劳工条件评估、材料溯源信息,这部分往往是体育供应链ESG里最容易缺失的一块。员工数据涉及人力系统里的基本用工信息。志愿者数据来自赛事管理系统,包括招募人数、培训完成情况、服务时长、岗位类型。社区和公益数据则要区分投入(捐赠金额、课程场次)、参与人数、持续时间和结果这几层,笼统地只记录"捐了多少钱"是不够的,这也是体育公益数据经常被诟病"只看筹款数字"的原因。

场馆与建筑类数据:光伏、储能、比赛日用能

如果ESG范围覆盖到绿色体育场馆,还需要单独一套建筑和运营数据:场馆建材信息、光伏装机容量、储能系统的充放电记录、赛事日程安排(决定用能高峰)、历史能耗曲线。这类数据的特点是时间颗粒度要求高,通常需要按小时甚至更细的粒度记录,才能支撑后续的能源分析和异常检测。

先有一张清单,再谈模型

把上面几类数据放在一起看会发现,体育ESG涉及的输入远不止"环保数据"这么简单,下面这张表大致列出了主要类别、典型来源和常见问题,供实际梳理时参考:

类别 典型来源常见问题
碳排放/能源电表、空调照明系统、燃气记录 Scope分类混淆,比赛日与非比赛日未分开
材料 产品设计、采购、供应商说明再生材料比例口径不统一
供应商合规审核、采购合同 中小供应商数据长期缺失
员工/志愿者 人力系统、赛事排班系统 工时统计口径不一致
社区/公益 项目台账、捐赠记录只记录投入金额,缺参与和结果数据
场馆/建筑建材记录、光伏储能系统历史能耗颗粒度太粗
赛事 赛事日程、观众人数统计 与能耗数据未做时间对齐

数据齐了以后才轮到模型

把这些数据分门别类整理好之后,大模型能做的是在统一的规则和口径下,把这些原本互不相通的表格归到同一套指标体系里,标出哪些字段是空的、哪些数据口径不一致,再生成便于人工核对的结构化汇总和报告初稿。它解决的是"整理"和"发现缺口"的问题,而不是凭空补出一个从未被记录过的数字。这也是理解体育ESG AI能力边界的起点——模型的输出质量,从一开始就被输入数据的完整程度决定了。

实践中比较合理的做法是先按上述几大类,梳理出一张数据来源清单,标注每类数据目前在哪个系统里、由谁负责更新、更新频率是多少,再决定优先补齐哪些缺口。这张清单本身,往往比急着让模型"先跑起来"更能决定最终ESG分析的可信度。