公司动态

扫描21,988部动漫,揭秘现实职业在动漫中的提及情况,成本仅34美元!

📅 2026/8/1 19:58:02
扫描21,988部动漫,揭秘现实职业在动漫中的提及情况,成本仅34美元!
导航菜单切换导航有登录选项还可进行外观设置。平台方面AI 代码创作包含 GitHub Copilot、GitHub Copilot 应用、MCP 注册表等开发者工作流涵盖 Actions、Codespaces、Issues、代码审查、代码质量等应用程序安全有 GitHub 高级安全、代码安全、密钥保护等探索部分包括为何选择 GitHub、文档、博客、更新日志、市场等还可查看所有功能。解决方案按公司规模划分有企业版、中小型团队版、初创企业版、非营利组织版按使用场景划分有应用现代化、DevSecOps、DevOps、CI/CD 等也能查看所有使用场景按行业划分有医疗保健、金融服务、制造业、政府机构等同样可查看所有行业还能查看所有解决方案。资源按主题探索有 AI、软件开发、DevOps、安全等也可查看所有主题按类型探索有客户案例、活动与网络研讨会、电子书与报告、商业洞察、GitHub 技能等支持与服务包含文档、客户支持、社区论坛、信任中心、合作伙伴等还可查看所有资源。开源部分社区有 GitHub 赞助项目有安全实验室、维护者社区、加速器、GitHub 明星项目、存档项目仓库有主题、热门趋势、合集。企业版有企业解决方案和可用插件还有定价选项。此外可进行搜索或跳转搜索代码、仓库、用户、问题、拉取请求等有搜索语法提示。还能提供反馈包含电子邮件地址以便联系有保存的搜索功能若要查看所有可用的限定符可参阅文档。有登录和注册选项若在另一个标签页或窗口有登录、注销、切换账户操作需重新加载以刷新会话。仓库相关有 elmiram/anime - professions 仓库公开状态有通知、复刻、加星等操作还有代码、问题、拉取请求、操作、项目、安全与质量、洞察等导航选项。主分支有分支和标签选项可转到文件、打开更多操作菜单。文件夹和文件有相关信息展示最新提交有历史记录可查看所有文件还有仓库文件导航。动漫职业项目动漫中实际展现了哪些现实世界的工作该项目扫描了 21,988 部动漫统计每种职业出现的频率有完整查找表与联合国/国际劳工组织 (ILO) 的标准职业分类 ISCO - 08 相对应最引人注目的是“缺失”列表。有实时探索器可搜索职业及查看发展趋势还有演示文稿展示有趣结果。一些发现如下教师是被提及最多的职业约出现在 1,370 部动漫中占比 7.6%因动漫常以学校为背景在 2020 年代店主取代教师成为被提及最多的职业若算上幻想角色皇室成员出现频率超过所有现实职业约 150 种角色可能被提及的职业中有 17 种从未在动漫中被提及如金融分析师、系统分析师等后台和服务类职业一些小众职业也有相应统计数据如软件开发人员 41 次保险代表 18 次药剂师 15 次电车/巴士司机 5 次。项目概述这是一个业余数据项目旨在构建职业分类体系检测动漫中对职业的提及使用大语言模型 (LLM) 对每次提及进行分类并生成每种职业的统计数据、按十年划分的统计结果、精确率/召回率估计以及三个 CSV 文件。同时有一个小型本地/静态 Web 应用程序可用于探索结果。现实职业与幻想职业层严格区分虚构角色会被统计但不计入现实职业总数。工作原理职业列表从 436 个精简到约 150 个职业按 ISCO - 08 列表分类因很多职业在故事中不会被明确提及所以精简为约 150 种角色可能被识别的职业其余约 286 种被标记为无法测试而非缺失。动漫中提及了 150 种职业中的 133 种从未提及的 17 种是显著发现。职业检测主要基于文本分为三个层面语料库 主角通过 AniList 获取每部动漫的剧情简介配角AniList 中的角色简介包含 角色 字段对白约 128,000 个日语字幕文件。检测过程分为两个阶段第一阶段高召回率使用关键字词典对文本进行广泛搜索允许误报第二阶段高精度由大语言模型Claude Haiku在上下文语境中判断每一个有歧义的候选句子。随后Claude Opus 会对确认的命中结果进行分层抽样评估以估计每种职业的精确率AniList 标签提供召回率基准精确率低于阈值的职业在输出中会被标记为不可靠。数据解读我们检测的是文本中被提及的职业屏幕上出现但未被明确标注的职业无法检测到“从未被提及”指从未在文本中被提及。约四分之一的被统计职业被标记为不可靠这些统计数据应视为上限。统计默认按系列作品去重但每部作品都会单独记录。每个百分比旁边都会注明分母约 18,127 部有可扫描文本的作品。数据来源与伦理考量动漫元数据、标题、角色简介、标签来自 AniListGraphQL API职业分类体系来自 ISCO - 08国际劳工组织对白来自一个社区存档的日语动漫字幕。字幕受版权保护该项目仅提取统计数据和定位信息从不存储或重新分发字幕文本导出的数据集和 Web 应用程序包含派生统计数据、标题和 AniList ID不包含字幕文本甚至不包含原始的 AniList 描述这是一个非商业粉丝项目。探索器与运行流程有两种方式运行相同的用户界面可通过命令启动本地服务器或预计算静态目录。自行运行流程需要 Python 3.11 及以上版本和 Anthropic API 密钥有一系列命令操作成本/规模参考显示完整运行该流程分析了 21,988 部动漫和 128,000 个字幕文件进行了约 101,000 次 Claude Haiku 判断 约 2,000 次 Opus 抽查总成本约为 34 美元大约需要一天的无人值守批量处理时间数据收集可恢复并遵守速率限制。仓库结构仓库有 ap 包包含 taxonomy.py、lexicon.py、jp_lexicon.py 等多个文件还有 ap.py 作为命令行界面入口点web/index.html 作为探索器前端。致谢与许可本项目使用了 Claude API 构建。数据版权归各自的提供者所有代码仅供参考发布展示的数据为派生数据且用于非商业用途。本项目与 AniList、MyAnimeList 或任何工作室均无关联。项目简介动漫中实际展现了哪些现实世界的工作对约 22,000 部作品按照 ISCO - 08 进行分类提供实时探索器和数据集。还有资源、加星、关注者、复刻等相关信息以及举报仓库选项。最后是页脚导航信息包含条款、隐私、安全、状态等内容。