给每本书拍过版权页,图片很快会堆成一整个文件夹。可当你要找某本书的出版者、出版日期或 ISBN(国际标准书号)时,还是得一张张打开照片。
要把版权页照片变成真正能使用的图书清单,关键不在于把所有文字都抄进 Excel,而在于让每个字段都有来源、每条记录都有状态,发现异常时能回到对应照片核对。
1. 先定义一行书目代表什么
最容易出错的地方,是一张表里混用了“一个书名一行”“一套书一行”和“一本实体书一行”三种规则。对于从版权页照片建立书目,建议先采用最稳妥的规则:一本实体书对应一行。
这样处理有两个好处:同名不同版不会被无意合并,照片来源也能和实体书一一对应。套装、上下册或多卷本可以在“册次”“套系”或“备注”列中说明,但不要用猜测的方式把它们压成一条记录。
每行至少要保留一个能回到照片的来源定位。
| 列名 | 填写内容 | 示例规则 | 作用 |
|---|---|---|---|
| 藏书编号 | 你为实体书编的编号 | A-01-001 | 回到书架 |
| 来源照片 | 图片文件名或路径 | A-01-001.jpg | 回看版权页 |
| 书名 | 版权页中的书名 | 看不清则留空 | 查找与区分 |
| 书目字段 | 责任者、出版者等 | 按字段拆列 | 结构化整理 |
| 复核状态 | 已复核或待复核 | 不确定先待复核 | 集中处理异常 |
💡照片不是附件,而是书目的一部分
书目表中的值可能需要修正,来源照片则是复核依据。先把照片定位写进表里,之后才不会为了一个可疑字段重新翻完整个文件夹。
2. 从最终 Excel 反推要提取的字段
版权页上的信息很多,但未必都需要进入你的第一张书目表。先写出确定会使用的列名,再决定 OCR 要找什么。
下面是一组常见的起始字段,可按自己的用途增减。
| 字段 | 取值来源 | 提取规则 | 缺失时怎么处理 |
|---|---|---|---|
| 书名 | 版权页 | 按页面原文提取 | 留空并待复核 |
| 责任者 | 版权页 | 作者、译者按需分列 | 不凭封面补写 |
| 出版者 | 版权页 | 记录页面写明的名称 | 留空并待复核 |
| 出版日期 | 版权页 | 先确定要保留的格式 | 保留原文或留空 |
| ISBN、CIP(图书在版编目数据) | 版权页 | 页面明确出现才填写 | 不做外部查询 |
书架位置、购买日期、阅读状态和个人标签不属于版权页字段,适合在导出 Excel 后自己补充。把“原件里有什么”和“我打算怎么管理”分开,表格会更清楚,也更容易维护。
3. 让照片、字段和行号对得上
先按书架、房间或处理批次整理文件夹,再给每张版权页照片一个稳定的名称。文件名不必复杂,但要能和 Excel 中的藏书编号对应。
例如,先处理 A 书架的第一批书时,可以把照片命名为A-01-001.jpg、A-01-002.jpg。对应的 Excel 记录也使用同一个藏书编号。后续看到待复核项,就能从编号定位照片,再从照片定位实体书。
在准备图片时,重点检查这些事项:
文字区域是否清晰,反光、阴影和装订线是否遮住字段。
一张照片是否只对应一本书的版权页,避免多本书混拍。
同一本书是否拍到了不同页面,若是,需要明确哪张是本次字段来源。
没有版权页或页面缺失的书,是否已保留照片并标记待补拍。
4. 批量提取后,先在原图旁核对字段
当照片名称和字段定义稳定后,就可以按批次导入图片。文档工作台可按字段名和字段描述提取信息,结果可与原始页面对照;确认后的字段可以导出为 Excel。
对图书清单来说,最有价值的不是“识别出最多文字”,而是每一列的含义稳定。例如,“责任者”到底只放作者,还是把作者和译者分别列出,应在导入前写清楚。规则不明确时,同一批书很容易得到难以比较的结果。
图 1:原始页面与按字段整理的结果并排显示,便于确认书目字段来自正确位置。图片来自文档工作台客户端。
下面的顺序适合先做小批量验证:
在 Excel 中建立列名、来源照片和复核状态。
选取一小批版权页照片,按书名、责任者、出版者等字段处理。
对照原图,集中检查空值、相似字符和同页出现多个候选值的情况。
导出字段结果,在 Excel 中补藏书编号、书架位置等个人管理列。
将未确认项保留为待复核,补拍或回看后再更新状态。
5. 给异常记录留出位置
图书整理中,最常见的异常不是识别完全失败,而是信息不完整或不能直接对应。可以把异常保留在表里,而不是删掉再靠记忆补。
| 异常情况 | 应保留的信息 | 处理方式 |
|---|---|---|
| 书名相同但版本不同 | 各自的来源照片和字段 | 分别建行,后续再说明关系 |
| 版权页没有某字段 | 来源照片和空值 | 标记待复核,不猜测 |
| 照片模糊或反光 | 藏书编号和待补拍状态 | 单独补拍 |
| 一页有多个候选值 | 页面原图和字段名称 | 按字段规则人工确认 |
尤其是 ISBN、出版日期等容易被视为“应该有答案”的列,缺失时也不应通过外部检索来填满。本文的任务是把照片上的信息整理为可核对表,不是替代图书编目或版本判断。
6. 导出 Excel 后,再做一次可用性检查
导出后的 Excel 可以继续成为你的长期书目表。交付或开始下一批前,抽查几条记录:能否由藏书编号找到实体书,能否由来源照片找到版权页,字段为空时是否有明确状态。
图 2:字段结果导出为 Excel 后,可继续添加书架位置、个人标签和复核状态。图片来自文档工作台客户端。
如果这些路径都通了,说明第一版表格已经可以使用。之后不论是继续拍下一层书架,还是补录以前遗漏的书,都沿用同一套编号、字段和复核规则即可。
7. 下载
文档工作台下载链接