公司源代码被AI抓取上传到网上了怎么追回来急

今天早上发现我们团队开发的某个核心模块的源代码被人传到了一个AI训练数据网站上,估计是哪个员工不小心把代码粘贴到AI对话里了。 那个网站偷偷抓取上传的内容用来训练模型,现在代码已经公开了,虽然只是部分片段,但含有关键算法。 我们公司就二十来个人,没有专门的安全部门。我已经通知了技术总监,他说先联系那个网站要求下架,但对方根本不理。 这种情况能报警吗?算不算侵犯商业秘密?还有没有别的办法把数据删掉?心里好慌,这代码花了大半年写的。

Viewed 0

今天早上发现我们团队开发的某个核心模块的源代码被人传到了一个AI训练数据网站上,估计是哪个员工不小心把代码粘贴到AI对话里了。

那个网站偷偷抓取上传的内容用来训练模型,现在代码已经公开了,虽然只是部分片段,但含有关键算法。

我们公司就二十来个人,没有专门的安全部门。我已经通知了技术总监,他说先联系那个网站要求下架,但对方根本不理。

这种情况能报警吗?算不算侵犯商业秘密?还有没有别的办法把数据删掉?心里好慌,这代码花了大半年写的。

1 Answers

现在要先稳住节奏:黄金处置窗口是发现后24小时内。你可以并行做3件事:1) 向涉事网站发出正式下架与删除通知并保留送达证据;2) 立刻进行代码风险隔离和密钥轮换,降低已泄内容可用性;3) 评估是否构成商业秘密泄露并准备材料向公安经侦报案。下架不一定完全成功,但越早行动,越有利于止扩散、固证与后续追责。

公司源代码被AI抓取上传 怎么定性与取证

  • 可能的法律路径

    • 商业秘密泄露:若该模块具备“不为公众所知悉、可为你方带来经济利益、经合理保密措施保护”,则泄露与抓取传播行为均可能涉及侵犯商业秘密(属刑民交叉领域,是否立案需警方审查)。
    • 计算机信息系统安全:若涉及未授权获取、非法侵入等,可与当地网安部门沟通研判。
    • 平台合规责任:数据抓取站点有内容处理义务,未及时响应删除请求可能构成不当处理个人/企业数据风险。
  • 你现在需要的证据清单(越具体越好)

    1. 泄露页面的完整URL、截图、抓包时间、快照哈希(可对片段计算 SHA256)
    2. 代码比对说明:泄露片段与你司仓库文件路径、提交ID、作者、首次出现时间
    3. 保密措施证明:仓库访问控制策略截图、员工保密协议/研发管理制度、代码标注的版权与保密声明
    4. 可能源头线索:谁在何时使用过外部AI工具(仅列时间与终端,不收集隐私),相关聊天/工具使用记录的存在性证明
    5. 影响评估:片段涉及的算法要点、可复现性、是否含密钥/配置

上述材料是报警、律师函、平台投诉和后续维权的关键支撑。涉及警方与网信渠道时,可参考公安部与国家网信办公开指引页面获取联系方式与政策口径:公安部国家网信办

立即到24小时内的动作梯度

  • 0-2小时

    1. 立刻撤换密钥/证书/令牌:轮换受影响环境变量与访问密钥,关闭可能被公开的调试端点。对生产与备份库分级执行,先高风险后低风险。
    2. 紧急分发“停用外部AI”指令:临时冻结把代码/配置粘贴到外部聊天机器人的行为,收拢可能的扩散面。
    3. 对涉事页面做不可交互取证:用只读设备抓取页面PDF/原始HTML与HTTP头部信息,计算哈希,记录时间。
  • 2-6小时

    1. 发起正式“下架/删除/禁止再训练”通知:
      • 发送英文与中文双语邮件、站内工单、以及法律联系人渠道,要求:永久删除该内容、从训练集与缓存中清除、停止再分发,并在7天内书面确认。
      • 附上权属声明、比对证据、保密性说明与公司信息。若无专人邮箱,在对方网站的“隐私/版权/DMCA/合规”入口与合作邮箱多渠道投递。对不配合平台,准备律师函。
    2. 提交违法和不良信息举报:若页面含明显侵权/未授权内容,可向 中央网信办举报中心12321 递交举报(附证据与平台不响应情况)。
    3. 对搜索与开源镜像做排查并DMCA风格通知:搜索泄露片段的特征字符串,列单清除,优先处理易被抓取的镜像与论坛。
  • 6-24小时

    1. 向属地公安经侦或网安部门咨询并提交报案材料:携上述证据、损失评估、保密措施证明说明。报警电话 110,或到当地经侦窗口咨询。反诈预警与专业咨询可拨 96110。
    2. 对客户与关键合作方发出“受控通报”:仅在必要最小范围内,说明处置进展与风险不扩散承诺,维护信任。
    3. 内部源审计与最小化暴露:审核Git权限、关闭无必要fork、启用跨仓敏感词预警(如密钥、算法标识符)、对历史PR做敏感差异扫描。

要下架与删除 具体怎么做更有效

  • 同一主张,多通道并发
    • 官方表单/工单 + 合作/法务邮箱 + 隐私/版权邮箱 + 社交媒体私信(仅留痕,不讨论细节)
    • 邮件主题包含:Unauthorized publication of proprietary source code – Request for takedown and deletion
  • 文书要点
    • 权属与保密声明:说明该代码为公司原创、未授权公开,属于商业秘密/专有技术
    • 精准定位:给出URL、代码文件名、行号范围、哈希指纹
    • 明确请求:下架页面、删除缓存与训练副本、禁止再训练、7日内书面确认
    • 法律后果提示:如不处理,将保留进一步追责权利(民事/行政/刑事)
  • 对比:有效 vs 无效做法
    • 有效:证据齐全、时限明确、连续催办(48小时一催)、保留收件回执
    • 无效:仅口头抱怨、不提供定位、不设时限、没有法律主体信息

若平台在境外、不回应或拒绝,继续固证并升级到律师函、跨平台搜索清除与司法路径。下架不等于删除训练副本,但仍可有效降低再分发与可见度。

技术面止损与未来防线

  • 立刻的技术止损

    • 失效化:轮换密钥、刷新令牌、替换可反推业务逻辑的关键常量
    • 降可用:修改服务器端校验逻辑,使泄露片段无法单独复现核心能力
    • 反爬与水印:对公开文档/接口加速率限制、代码内增加“蜜标”便于未来溯源
  • 中小团队可落地的三件事

    1. 敏感输出网关:给外部AI使用建立“红线词过滤代理”,命中源码/密钥/客户信息即阻断;或采用企业版AI并签数据不用于训练条款。
    2. 仓库与终端防护:最小权限、强制2FA、保护分支;在IDE与CI加入“secret scanner/敏感片段扫描”(如检测 private key、算法标识符)。
    3. 制度与签署:全员NDA、保密等级标识、外部分享审批流;入离职交接与代码持有清单。对外协统一签保密与不反向工程条款。
  • 安全做法 vs 不安全做法

    • 安全:企业版AI或自建模型、关闭训练、只传经脱敏与裁剪后的样例
    • 不安全:把完整源码/密钥/客户数据直接粘贴到公开AI对话或论坛

权威渠道可用于举报与咨询:公安部 获取属地部门信息;对网络有害信息与未授权传播,可在 中央网信办举报中心 提交;涉及垃圾信息分发线索可同步 12321

本答复不构成最终法律意见。是否构成侵犯商业秘密、是否立案与追责力度,需结合你方保密措施、代码价值、泄露路径与扩散范围,由有管辖权的机关与法院综合认定。涉及重大损失或潜在金额超过5万元的处置与取证,建议尽快联系本地律师与司法鉴定机构同步推进。

Related