公司动态
新书到馆几百册,编目录入到手软?把PDF版权页一键导出Excel,图书信息批量搞定
你以为编目最难的是分类标引其实最难的是手敲几百次键盘新学期开学第二周编目室的推车上堆满了刚到的几百本新书。你翻开第一本的版权页——密密麻麻的小字挤在半页纸上书名、作者、出版社、出版年月、ISBN、中图分类号、页数、CIP数据。盯着看了五秒开始逐条敲进图书馆管理系统。一本录完下一本。录到第十本肩膀开始发酸。录到第三十本眼睛已经花了一串13位的ISBN看成了12位。录到第五十本你突然不确定刚才那本北京大学出版社到底敲成了北京还是背景。你停下来想倒回去核对。但前面那几十本的书已经归到推车底层去了哪本对不上号你也不知道。重新逐本翻出来比对——比录入还费时间。抬头看看推车还有一大半没动。而月底编目积压量的报表已经发到馆长邮箱了。编目录入不是脑力活是体力活。每一本书的信息都清清楚楚印在版权页上但要把它们变成系统里的一行行数据中间隔了成百上千次翻页、辨认、敲键盘、来回检查。不需要手敲拖进去就完事文档工作台做的事就是把从PDF版权页搬到Excel这一步从几周压缩到一两天。不需要联网不需要上传到任何平台。你只需要把图书版权页扫描成PDF——用扫描仪批量扫也好用手机一张张拍也好——然后全部拖进工具。接着告诉工具你要提取哪些字段书名、作者、出版社、出版年月、ISBN、中图分类号、页数、CIP。你可以一个个添加字段名也可以直接把你们馆里用的Excel模板拖进去——工具自动解析出字段配置省去手动设置的功夫。点击开始。工具在本地用OCR引擎逐页识别版权页内容——所有数据跑在你的电脑上没有一页版权页出过你的电脑。识别完成后点击导出——所有图书信息整齐排列在一张Excel表上。书名、作者、出版社、ISBN、中图分类号——每一列清清楚楚格式标准。你不再需要翻开任何一本书的版权页逐条核对。在这个过程中文档工作台一共做了三件事第一逐页识别版权页提取所有编目关键字段。书名、作者、出版社、出版年月、ISBN、中图分类号、页数、CIP——从每张PDF版权页中自动精准提取。不管版权页字体大小、排版方向、纸张是否泛黄模糊。第二自动整理为规范表格结构。你设定的字段就是Excel的列名识别的结果就是行数据。不再需要手动对齐、调格式、逐条检查错字漏字。第三一键导出为Excel编目清单。导出后可以直接导入图书馆管理系统也可以先微调再批量入库。原本要花好几个星期对着几百本版权页逐本敲键盘现在扫描成PDF、拖进去、配字段、等处理——一两天内全部搞定包括你核验数据的时间。调一调让它更贴合你们馆的编目规范第一次跑完后你可以根据本馆的编目要求做微调。比如有些馆要求加上丛书名字段有些需要价格列有些中图分类号格式有特殊规范——在字段配置里增减你需要的列名重新跑一次即可。如果系统对入库格式有严格要求——比如中图分类号的冒号分隔、出版年月的日期格式——导出后在Excel里批量处理一下就能直接导入。字段配置的灵活性意味着同一个工具可以适配不同图书馆的编目习惯不用为每个馆单独找一套方案。工具省掉的是识别和录入的时间不是编目员的专业判断。写在最后不只是大学编目馆员。公共图书馆采编人员核对CIP数据、中小学图书管理员登记新书、出版社编辑整理书目交换数据、旧书商批量登记收书信息——所有需要从图书版权页提取结构化信息的岗位都面临同一个困境信息明明就印在纸上但要让它们变成能用的数据中间隔着成百上千次手敲键盘。一本版权页敲错一个ISBN书在系统里就查不到。一条记录出错读者找不到书投诉反馈最终打到你头上。更严重的是一次录入返工意味着你要在堆积如山的新书里重新翻出那本书、重新翻开版权页、重新敲一遍——这个时间成本比敲错一个数字的代价高得多。但这里有个关键区别编目工作中的录数据和做编目是两回事。录数据是翻版权页、辨认小字、敲键盘、校对比对——这些交给文档工作台批量跑完字段整齐、格式标准。做编目是判断分类、规范标引、确保书目质量——这才是编目员的专业价值所在。把录数据交给工具把做编目留给自己。编目员不该是版权页的搬运工。文档工作台下载链接https://pan.quark.cn/s/82ef5efcf992本地安装几步上手。下次新书到馆试试先把版权页一锅端进Excel。