0xSero/ai-data-extraction

自动发现并扫描AI编程助手在本地存储的数据文件,解析SQLite数据库、JSONL会话文件等不同格式,提取用户消息、AI回复、代码上下文、代码差异、工具调用结果等,并输出为结构化的JSONL文件。

一句话商业模式

为AI训练数据收集者、开发者、研究者解决AI编程助手(如Cursor、Claude Code等)的数据无法直接导出或备份,数据被锁定在本地存储中,通过开源的数据提取工具集,支持多种AI编程助手的数据提取提供价值,主要依靠目前无明确收费模式,假设可能通过企业支持服务或定制化服务盈利赚钱

商业模式画布

提供一键式数据提取工具,自动发现并解析多种AI编程助手的本地数据,输出为统一格式的JSONL文件,让用户能够自由获取和使用自己的数据

评分解析

研究分 68

这是什么

是什么
一个开源的数据提取工具集,能够从多种AI编程助手(如Cursor、Claude Code、Codex、Windsurf、Trae、Continue、Gemini CLI、OpenCode)中提取完整的对话历史、代码上下文和编辑记录。
给谁用
AI训练数据收集者、希望备份个人AI编程数据的开发者、研究AI辅助编程行为的研究者、以及需要迁移或分析AI编程工具数据的用户。
← 返回今日精选
0

0xSero/ai-data-extraction

自动发现并扫描AI编程助手在本地存储的数据文件,解析SQLite数据库、JSONL会话文件等不同格式,提取用户消息、AI回复、代码上下文、代码差异、工具调用结果等,并输出为结构化的JSONL文件。

68

一句话商业模式

为AI训练数据收集者、开发者、研究者解决AI编程助手(如Cursor、Claude Code等)的数据无法直接导出或备份,数据被锁定在本地存储中,通过开源的数据提取工具集,支持多种AI编程助手的数据提取提供价值,主要依靠目前无明确收费模式,假设可能通过企业支持服务或定制化服务盈利赚钱

开发者工具AI开源数据提取开发者工具团队 未知,推测为独立开发者或小团队发布 2025年11月16日(GitHub创建日期)最后同步 2026-08-16

商业模式画布

Business Model Canvas · 9 大模块完整填涂

重要合作Key Partnerships
无明确合作伙伴,可能依赖AI编程工具社区的用户反馈
关键业务Key Activities
维护和更新提取脚本以适配AI编程工具的新版本、处理用户反馈和issue、优化数据提取的完整性和准确性
价值主张Value Propositions
提供一键式数据提取工具,自动发现并解析多种AI编程助手的本地数据,输出为统一格式的JSONL文件,让用户能够自由获取和使用自己的数据
客户关系Customer Relationships
通过GitHub Issues和Pull Requests与用户互动,开源社区驱动
客户细分Customer Segments
AI训练数据收集者、希望备份AI编程数据的开发者、研究AI辅助编程行为的研究者
核心资源Key Resources
GitHub仓库、Python脚本、社区贡献者
渠道通路Channels
通过GitHub开源社区传播、在Hacker News等开发者社区分享、以及被AI编程工具用户自发推荐
成本结构Cost Structure
开发者时间成本、GitHub托管费用(免费)、可能的法律合规咨询
收入来源Revenue Streams
目前完全免费开源,潜在收费方式可能包括企业级技术支持、定制化数据清洗服务、或与AI训练平台合作的数据服务
💡 核心痛点:AI编程助手(如Cursor、Claude Code等)的数据被锁定在本地存储中,无法直接导出或备份,用户无法获取自己的对话历史、代码上下文等数据用于训练、分析或迁移⚠️ 最大风险:AI编程工具可能更新数据存储格式导致工具失效,需要持续维护;部分工具可能限制数据提取或视为违规行为

评分解析

痛点清晰度

AI编程助手数据无法导出是明确痛点,用户有备份、迁移、训练等需求,工具直接解决此问题

置信度 80%
85
付费可能性

项目完全开源免费,无明确收费模式。潜在收费方向(企业支持、定制服务)市场规模有限,且开源社区可能抵制商业化

置信度 60%
40
市场与趋势

AI编程工具市场快速增长(Cursor、Claude Code等用户量激增),数据提取需求随之上升,但工具本身是辅助性产品,市场规模相对较小

置信度 70%
75
需求信号

GitHub星标1128且日增66星,进入Trending榜单,表明开发者社区有明确需求。但10个open issues也反映用户有改进需求

置信度 75%
70
执行可行性

项目技术实现清晰,使用Python标准库无依赖,脚本结构模块化,易于维护和扩展。但需持续跟进AI编程工具更新

置信度 80%
80
中国市场适配

中国开发者使用Cursor、Claude Code等工具日益增多,数据备份需求存在。但工具主要面向英文用户,且部分AI编程工具在中国使用受限

置信度 60%
60

这是什么

是什么
一个开源的数据提取工具集,能够从多种AI编程助手(如Cursor、Claude Code、Codex、Windsurf、Trae、Continue、Gemini CLI、OpenCode)中提取完整的对话历史、代码上下文和编辑记录。
给谁用
AI训练数据收集者、希望备份个人AI编程数据的开发者、研究AI辅助编程行为的研究者、以及需要迁移或分析AI编程工具数据的用户。

关键能力

  • 支持8种主流AI编程助手:Cursor、Claude Code、Codex、Windsurf、Trae、Continue、Gemini CLI、OpenCode
  • 自动检测操作系统(macOS/Linux/Windows)并搜索常见存储位置
  • 解析多种数据格式:SQLite数据库、JSONL会话文件、JSON文件、Tauri .dat文件
  • 提取完整数据:用户消息、AI回复、代码上下文、代码差异、工具调用结果、时间戳、模型信息
  • 输出为统一的JSONL格式,便于后续处理和分析
  • 无需额外依赖,仅使用Python 3标准库即可运行

创业线索

团队
未知,推测为独立开发者或小团队 · GitHub仓库由用户0xSero创建,无明确团队信息
发布时间
2025年11月16日(GitHub创建日期) · 项目较新,创建于2025年11月,最近推送在2026年1月21日,仍在活跃维护
增长线索
GitHub星标1128,日增66星,进入GitHub Trending第57位,增长较快
能赚多少 / 怎么赚
无 · 无明确收费信息,项目完全开源免费

公开信息推断,缺数据会标未知;不构成收益承诺。

GitHub 最新数据

  • 仓库:0xSero/ai-data-extraction
  • 星标:1,128
  • 分支:96
  • 关注:5
  • 未关闭 Issue:10
  • 主语言:Python
  • 仓库创建:2025-11-16
  • 最近推送:2026-01-21
  • 描述:extract all your personal data history from cursor, codex, claude-code, windsurf, and trae

来源数据

  • 首次采集:2026-08-16
  • 最后同步:2026-08-16
  • 材料更新:2026-08-16
  • GitHub 星标:1,128
  • GitHub 分支:96
  • 穿透材料体量:约 8,459 字

AI 辅助分析,仅供项目研究参考,不构成投资建议。