Jea
发布于 2026-09-08 / 36 阅读
0
0

文献修复与数智化文创开发智慧教学工具

文献修复与数智化加工教学工具

一期核心功能与资源需求

围绕一份古籍文献,组织学生完成“资料整理—修复学习与演练—文字校订—知识整理”,形成可提交、可评价的学习成果。建设简单的管理端、实用的教师端,以及学生网页端和微信小程序,支持约50名学生同时上课。

一、管理端

  • 人员与班级:管理教师、学生及班级,设置各自可使用的课程和资料。
  • 教学资源:管理文献案例、工具材料介绍、步骤示范及题目,支持分类、开放和停用。
  • 基础维护:查看文件使用量和异常情况,做好资料与作业备份。

二、教师端

  • 课程与任务:建立课程,选择教学专题,向班级发布学习、练习、测试及作业要求。
  • 备课与案例:选用已有案例,补充图片、视频、工具方法、修复步骤、题目解析及参考方案。
  • 过程指导:查看学生学到哪一步、哪些题目或操作出现问题,提供针对性反馈。
  • 作业评阅:查看修复方案、文字校订和知识整理成果,批注、评分、退回修改,导出成绩与报告。

教师可以只布置某个环节,也可以组织一次完整的文献加工任务。

三、学生网页端

电脑端用于完整操作和成果整理,重点包含四个模块。

模块学生可以做什么形成什么成果
数据建设导入图片或PDF、使用手机上传资料、从平台内部案例库选材;整理册页顺序、检查缺页并填写来源文献资料包
修复学习与交互学习完整方案和步骤,观察病害,选择工具、材料和方法;在教学图片上操作,查看错误原因并重练修复方案、操作记录和前后对照
文字识读与校对勘误对照原图录入文字,或修改老师提供的初稿;改错、补录、标记疑难字并说明依据校订文本、勘误表
内容理解与知识整理从原文中选取人物、地点、事件、术语等内容,填写解释、出处及相互关系知识卡片、关系图和知识报告

修复模块是重点操作环节。 学生需要经历“看案例—学步骤—选方法与工具—动手演练—检查结果—修改重练—编写方案”,不能只看视频或答题。演练支持工具拖放、区域选择、步骤判断和局部示意操作。

完整修复方案覆盖收书清点、修前检查、病害调查、工具方法、修复步骤、自检验收、包装存放或交还。开展线下实训时,可补充操作照片和教师评价。学生还可将整理出的图文知识用于简单文创作品,并提交来源说明。

四、学生微信小程序

小程序用于随时学习、课堂演练和现场采集,与网页端使用同一份课程和作业资料。

  • 选课与学习:进入老师的课程,选择“古籍缺损修补”等专题,查看图文、短视频和步骤说明。
  • 答题与测试:完成观察题、方法选择、步骤排序及单元测试,查看解析和需要复习的内容。
  • 修复演练:在预设场景中选择工具并拖到指定区域,判断方法与处理顺序,答错或操作有误时查看原因并重练。
  • 资料与作业:拍照上传文献和实操过程,完成短段校订、简单知识卡片及修复方案分章填写。
  • 反馈与接续:查看教师意见、修改重交;复杂图像操作、长文编辑和关系整理可转到电脑继续。

课堂示例: 老师发布“古籍缺损修补与内容整理”任务,学生领取文献资料,学习并演练修补步骤,校订指定页面的文字,再提取知识点,最终提交修复方案、校订稿和知识报告,由老师统一评阅。

文献修复与数智化加工教学工具:业务流程图

先看总流程,再按图号查看详细流转。箭头表示下一步,菱形表示判断;退回与重练均回到具体处理环节。学生网页端和小程序使用同一份课程、文献与作业。

一期不使用人工智能,不接外部文献数据库。文字处理为人工识读或导入教师初稿后的校订。教学演练与真实修复记录分别标明。

图1:管理、教学与学生操作总流程

否
是
是
否
是
否
管理端:准备账号与班级
管理端:整理并开放教学资源
教师端:建立课程与专题
教师端:选择案例、设置学习任务与评分要求
材料与要求是否齐全
教师端:向指定班级发布
学生网页或小程序:进入课程并领取任务
图2:拍照、导入或内部案例库选材
任务是否包含修复且文献需要修复
图3:修复学习、演练与方案
记录无需修复理由或本任务范围
图4:按任务完成文字识读与校订
图5:按任务完成知识整理
是否布置文创成果
选用图文知识、制作或上传作品并说明来源
汇总本任务要求的成果
图6:提交、教师评阅、修改重交
成绩与成果归档
学生查看报告与个人学习成果

图中展示综合任务。单环节任务只执行教师选定环节:修复任务可直接提交修复成果,知识任务可使用教师给定文本;跳过环节不记为已完成。无修复需求的学生应说明依据,不必编造修复记录。

图2:文献资料建设

小程序
网页
内部案例库
否
重试或重新选材
是
否
是
能
不能
允许
需补充或换材料
进入课程任务
选择资料来源
拍照或选择相册图片
导入图片或PDF
选择老师开放的文献
确认题名、册卷、页号与来源
上传文件或领取案例副本
是否保存成功
保留待处理记录、查看原因
查看页面、核对清晰度与页序
是否有缺页、模糊或来源问题
保存文献资料包
能否补充
补拍、补页、调序或补充来源
记录原因并请教师核查
教师是否允许按现状继续
进入任务要求的修复、校订或知识环节

原始资料始终保留,调整图片另存副本。上传失败不会被标为完成;教师允许保留的缺页或未知项随成果一起展示。

图3:修复学习、演练与完整方案

需复习
可以继续
否
调整选择并重练
是
否
是
否
是
是
否
有
无
补学
补测
否
是
领取修复任务与文献
学习完整案例方案
学习步骤、工具材料与适用条件
完成观察题与方法判断
是否理解本步要求
标注病害并选择方法、工具和材料
按步骤进行工具拖放、区域操作或情景判断
操作是否符合案例要求
查看错误原因与对应步骤
是否完成全部指定步骤
查看结果、对照与操作复盘
教师是否要求单元测试
编写个人修复方案
参加单元测试
是否达标
查看解析并复习
是否还有测试机会
教师安排补学或补测
补齐收书、检查、修复、验收与存放计划
是否包含线下实操
提交教学模拟方案与演练成果
进入图3A:方案审批与线下记录
进入后续加工或图6作业评阅

完整方案按收书清点、修前检查、病害调查、方法工具、工序安排、自检验收、包装存放或交还组织。示意操作成功与测试达标,不代表实体修复已完成。

图3A:有线下实训时的审批、实施与存放

否
是
是
补充检查或修改方案
允许按原方案继续
终止
否
否
是
否,按原方案返工
否,需调整方案
是
否
是
提交拟实施方案
教师审核方案
是否批准
按意见补充检查或修改方案
按批准方案进行线下实训
记录工序、人员、材料与操作照片
是否发现异常或需要变更
暂停相关操作并报告教师
教师决定如何处理
记录未完成范围与终止原因
工序是否全部完成
学生自检并申请验收
教师验收
是否通过
整理包装、标签与保管说明
入库存放或交还
登记临时保管或交还安排
确认保管或接收人员与凭证
交接是否确认
核查去向、数量与凭证
归集实际记录,保留完成或终止状态
进入后续教学环节或图6作业评阅

临时保管不等于正式入库。终止项目保留未完成状态和实际去向,不标成验收通过;后续教学范围由教师确定。

图4:文字识读与校对勘误

有
无
录入错误或漏录
字形不清或缺损
无问题
能
仍不能
否
是
需补充
符合,或允许带存疑继续
选择文献原图与页码
是否有老师提供的文字初稿
导入初稿并对应页面
对照原图手工识读录入
逐页逐段核对图文
发现什么问题
修改文字并记录理由
保留字形图片、标记存疑或缺文
保存本段核对结果
查阅允许使用的资料或向教师提问
能否确认
保留未决标记与说明
是否完成指定范围
汇总校订文本、勘误表与未决清单
是否符合任务提交要求
保存本次校订成果
进入知识加工或图6作业评阅

原文、校订改动及阅读解释分别保留;无法辨认的内容不强行补成确定文字。教师复核意见通过图6退回到对应字词。

图5:内容理解、知识整理与应用

否
能
暂不能
是
是
否
是
否
否
是
是
否
所引原文发生修改
选择校订文本或教师提供的文本
选取原文片段
建立人物、地点、事件或术语等知识卡
填写名称、解释、属性与出处
依据是否充分
补查资料或向教师提问
能否核实
保留待核实说明
标记本人已核对
任务是否要求建立关系
选起点和终点、填写关系及原文依据
关系是否有依据
修正关系或标为待核实
查看卡片、关系列表和关系图
数量、出处和状态是否符合任务要求
保存知识卡片、关系及知识报告
是否布置文创
选用已确认图文知识制作或上传作品
补充设计说明与来源
进入图6作业评阅
提示相关知识需要重新核对

待核实内容不会自动变成确定知识。关系图展示学生录入且有状态标记的内容,不自行推断关系;是否允许带存疑提交由教师任务要求决定。

图6:提交、教师反馈与修改重交

否
是
是
文献资料
修复方案或操作
文字校订
知识或作品
同步补充相关内容
否
有
需改作业
确认或更正评分,记录原因
无
学生汇总老师要求的成果
检查保存状态、附件与必交项
资料是否齐全并已保存
定位缺项、补充或重试上传
预览并正式提交
固定本次提交内容
教师查看资料、操作、文字与知识成果
是否需要修改
教师标注具体问题并退回
问题属于哪个环节
返回图2对应资料
返回图3对应步骤或方案
返回图4对应字词
返回图5对应内容
完成修改并回复教师
检查修改是否影响后续成果
教师评分并发布评语
学生查看成绩与反馈
是否有需要复核的问题
学生提出问题,教师复核
确认最终成绩与成果
导出报告、课程归档与个人作品保存

每次提交、重交和评分均保留记录。教师正在评阅的内容不会被学生的新草稿改变;上游修改影响知识或作品时,重交前一并核对。

图7:学生网页与小程序如何接续

小程序
网页
有
无
否
恢复后重试
是
继续当前操作
换端处理
提交作业
学生进入同一账号下的课程任务
本次使用哪个端
学习答题、有限演练、拍照及短段编辑
完整图像操作、长文校订、关系与报告整理
保存当前内容和学习位置
是否有同时修改冲突
保留双方内容,比较并选择或合并
是否保存成功
保留当前输入、提示网络或文件问题
接下来做什么
另一端打开同一任务并恢复已保存内容
进入图6的提交检查

换端只接续已成功保存的内容,未上传完成的照片不能显示为另一端可用。需网页完成的精细活动提前标明,手机已完成的非等价练习不自动替代该活动。

流转结果核对

起点流向与返回最终落点
管理端准备资源教师建课、发布 → 学生领取课程与任务
数据建设三种来源 → 检查 → 补充或教师确认文献资料包
修复训练学习 → 判断 → 操作 → 反馈重练 → 方案修复方案与操作成果
线下实训审批 → 实施 → 异常处理或返工 → 验收与交接实际档案,或保留终止状态的记录
文字校订识读 → 改错或标疑 → 核查 → 保存校订文本与勘误表
知识加工原文 → 卡片 → 关系 → 核查 → 应用知识报告与可选文创成果
提交评阅提交 → 教师反馈 → 对应环节修改 → 重交成绩、报告与归档
双端操作保存 → 冲突或失败处理 → 接续或提交同一份课程作业

二期接入人工智能后的流程调整

一期按“完整排除人工智能”建设。二期加入 AI,在原有环节前插入一步“机器出草稿”,原有的人工核对、教师审核、退回重交路径全部保留。下列图8至图11对应图1、图4、图5、图3的改造点,未画出的环节与一期一致。

三条基本原则:

  • AI 只出草稿,人工负责定稿。 识别、抽取、推荐的结果一律进入待确认状态,学生逐条核对、教师审核后才成为正式成果,不得直接流入提交版本。
  • 每条结果可追溯、可退回。 记录人工还是机器产生、模型版本、生成时间与把握程度,界面明确标识,随时可撤回改回人工。
  • 不碰专业判断与实物责任。 实体工艺选择、修复验收、成绩认定仍由教师负责。AI 生成的补配效果图只作示意,加标记并与原图、处理图分开保存,不作为修复完成的证据。
  • 二期不做模型训练。 全部采用现成模型、开放接口与传统算法,不组织标注、不做微调、不自建训练集。这直接决定能力边界:机器只承担定位、转写、比对、生成示意这类通用工作,凡需要古籍修复专业知识才能判断的部分一律留给师生。

图8:AI 辅助下的任务总流程

否
是
否
是
否
是
否
是
教师发布任务并设定AI使用范围
学生领取文献与任务
本环节是否开启AI辅助
按一期人工流程完成
调用识别或抽取服务生成草稿
服务是否可用且在额度内
草稿进入待确认状态并标注来源与把握程度
学生逐条核对、修改或推翻
是否逐条确认完毕
形成学生定稿并记录改动
教师评阅,可对照机器初稿与学生定稿
改动是否体现自行判断
退回并指明需学生自己完成的部分
评分归档,保留AI使用记录

服务不可用或超出额度时自动退回一期人工流程,课堂不中断。未经学生逐条确认的草稿不计入完成进度,也不能提交。

图9:AI 辅助文字识读与校对,对应图4

教师提供
人工录入
机器识别
否
是
机器错字或漏字
字形不清或缺损
无问题
能
仍不能
否
是
选择文献原图与页码
文字初稿来源
导入初稿并对应页面
对照原图手工识读
调用古籍识别服务生成初稿
识别是否成功
逐字给出把握程度,低把握处标记重点核对
逐页逐段核对图文
发现什么问题
修改文字并记录理由
保留字形图片、标记存疑或缺文
确认本段,来源由机器转为人工已核
查阅允许使用的资料或向教师提问
能否确认
保留未决标记与说明
是否完成指定范围
汇总校订文本、勘误表、未决清单与机器改动统计
进入知识加工或图6作业评阅

机器初稿与学生定稿分别保存,改动统计供教师判断学生是否真正核对。未经核对的识别结果仍标为机器来源,不能充当校订成果。

图10:AI 辅助知识整理,对应图5

否
是
不成立
成立但有误
成立
是
否
是
否
否
是
所引原文发生修改
选择已确认的校订文本或教师文本
是否使用机器抽取
按一期方式人工建立知识卡
自动提取人物、地点、事件与术语候选
每条候选给出原文位置与推荐理由
学生逐条判断
该候选是否成立
删除并说明原因
修改名称、解释、属性与出处
采纳并标记本人已核对
汇总知识卡片
任务是否要求建立关系
机器推荐关系候选并附原文依据
原文依据是否支持
修正关系或标为待核实
确认关系并记录依据
查看卡片、关系列表与关系图
数量、出处与状态是否符合任务要求
保存知识报告,注明机器候选采纳与否决情况
进入图6作业评阅
提示相关知识与机器候选需重新核对

机器候选不自动成为知识卡片,未判断的候选不计入成果数量。否决记录同样保留,可作为学生理解程度的评价依据。

图11:AI 辅助病害圈选与方法参考,对应图3

否
是
是
否
否
是
归档原图与教师认定结果
学生上传或选取文献图
学生点选一处疑似病害
通用分割模型自动圈出区域边界
边界是否贴合实际范围
拖拽调整或重新点选
学生自行判定病害类型与程度
系统按边界计算面积与占比
是否还有其他病害
汇总病害清单
按学生填写的类型检索教师已审定的案例与方法
展示适用条件、不适用情形与案例出处
学生自选方法并说明选择依据
教师是否认可
指出问题,学生重新判断
进入图3演练或图3A线下实施
留存成对资料,供日后评估是否值得训练

不训练的前提下,模型只负责“圈得准”,不负责“判得对”。病害类型、程度与处理方法全部由学生判定、教师审核;方法参考是按学生填写的类型去检索教师已审定的案例库,属于检索与条件匹配,不是模型推断。这样既免去标注与训练投入,又把专业判断完整留在教学环节里,反而更贴合课程目标。成对资料继续归档,是否值得训练留到三期再评估。

二期能力优先级

模块可增加的能力建议优先级
文字识读与校对古籍识别生成初稿、自动断句标点、异体字与疑难字候选、对校提示疑似讹误高,见图9
内容理解与知识整理自动提取实体、推荐关系与出处、生成知识报告初稿高,见图10
数据建设自动裁边纠偏、图像增强、册页顺序与缺页初判、自动分类命名高,并入图2
教学管理自动出题组卷、客观题判分、主观题评语建议、学情与薄弱环节分析中,并入图6
修复学习与交互病害区域交互式圈选、案例库方法检索、演练过程按规则点评中,见图11,用现成分割模型
学习辅导基于本课程资料的问答助手,只答教材与案例范围内问题并给出处中
修复效果与文创补配效果示意图、纹样提取再设计、文创文案生成低,风险最高,最后做

建议二期先做文字与知识两块:投入小、效果直观、对一期结构冲击最小,正好补上一期最费人工的环节。

AI 技术在不训练前提下的可参与程度

针对需求中提出的图像分割、图像修复模型、古籍专项 OCR、智能勘误算法四项,结论是四项都能参与,但参与方式与原设想不同:都改为使用现成能力,把需要专业知识的判断交回师生。

技术项可参与程度用什么现成能力教学定位
图像分割高,见图11通用交互式分割模型零样本可用,点选即出边界;版面与栏行切分用现成版面分析组件机器做描边这类体力活,病害类型与程度由学生判定
图像修复模型中,限定为示意现成图像补全模型可补纸张缺口、去污渍褶皱,生成修复后效果预览只用于修前修后对比与方案讨论,加水印、独立保存,不进修复档案
古籍专项 OCR高,见图9三选一或并用:已开放的古籍识别平台接口、通用视觉大模型零样本识别、开源古籍识别权重直接推理只出初稿,逐字标把握程度,低把握处提示重点核对
智能勘误算法高,且最不依赖训练传统比对算法加字表规则,辅以现成大模型判断文意输出疑似清单交学生判断,与校勘学方法直接对应

智能勘误这一项最值得优先做,它本来就不需要训练,且能与课程内容严丝合缝地对应:

校勘方法系统实现方式是否需要训练
对校两种识别结果或两个版本逐字比对,差异处自动标出否,纯比对算法
本校统计全书内部同一人名、地名、术语的用字不一致处否,统计规则
他校与教师提供的权威电子文本比对否,比对算法
理校现成大模型判断文意是否通顺、是否存在形近字讹误否,提示词即可
字形规则避讳字、异体字、常见形近字对照表比对否,字表由教师提供,属资料录入

字表与权威文本属于教学资料录入,不是模型训练,由教师提供后系统直接使用,这也正是一期第六节“需学校与教师提供的教学资源”的自然延伸。

两条技术路线

路线做法适用情况
调用外部模型服务按次付费调用成熟的识别与语言模型,学校不购置显卡服务器起步快、投入低;需确认文献授权允许外发,并做脱敏与额度控制
校内私有化部署在校内服务器部署开源模型,资料不出校园涉及未公开馆藏或合规要求严格时采用;需增配显卡服务器与运维人员

也可混合:公开教学案例走外部服务,未公开文献走校内部署。古籍识别应选用已针对古籍的现成模型或开放平台,通用识别对竖排、异体字与批注效果通常不足;因二期不做微调,选型只能靠实测比选。两条路线都要设置调用上限与失败兜底,如图8所示退回人工流程。

路线一价格参考:以 DeepSeek 开放平台为例

计费项时段通用对话模型深度思考模型
每百万 tokens 输入,缓存命中空闲时段0.02元0.15元
每百万 tokens 输入,缓存命中高峰时段0.04元0.30元
每百万 tokens 输入,缓存未命中空闲时段1元4.5元
每百万 tokens 输入,缓存未命中高峰时段2元9.0元
每百万 tokens 输出空闲时段4元13.5元
每百万 tokens 输出高峰时段8元27.0元
并发限制—2500500

需注意上述价格只适用于纯文本环节,即知识抽取、断句标点、评语建议与问答助手。古籍文字识别与病害识别需要能看图的模型,费用另计,DeepSeek 目前不提供视觉模型,需另选视觉服务商或按路线二自建。图片输入的 token 消耗远高于文本,涉及批量识图时须先用实际课件做小批量试算,再确定额度。

路线二自建推荐模型

以下均为直接部署现成权重做推理,不含训练与微调。

用途推荐模型硬件需求说明
知识抽取、断句标点、理校提示、评语建议、问答助手Qwen3-14B 或 Qwen3-32B 量化版;备选 GLM-4 系列、DeepSeek-R1-Distill-Qwen-32B14B 单卡 24G 可跑,32B 建议 48G 或双卡中文与文言表现较好,靠提示词与教师提供的字表规则约束,不靠微调
古籍文字识别GOT-OCR2.0、PaddleOCR 古籍与竖排相关现成模型、Qwen-VL 系列直接推理单卡 24G 起用开源权重原样推理,效果以实测为准;效果不足的版本类型退回人工识读,不靠训练补救
病害区域圈选SAM2 等通用分割模型交互式使用,学生点选即出边界单卡 24G 即可推理零样本可用,无需标注;不做类型判定
修复效果示意LaMa 等图像补全模型,或现成生成模型的局部重绘能力单卡 24G 起仅生成示意图,输出加水印独立存放;禁止用于补文字笔画
图像纠偏、去污、增强OpenCV 传统算法为主,配合 Real-ESRGAN 超分与文档展平模型单卡或纯 CPU多数处理不需要大模型
资料检索与问答底座bge-m3 等中文向量模型,配合开源向量库显存占用很小支撑“只答教材与案例范围内问题”的助手

不建议自建满血级大模型(DeepSeek-V3、R1 等 600 亿参数以上的原版):需要 8 卡整机,采购与机房改造在数十万元以上,50 人教学场景远用不满,这类能力用路线一更合适。自建应以 14B 至 32B 级别模型加专用小模型为主。

档位配置可支撑
起步1 张 24G 显存显卡14B 以内语言模型、分割、识别、补全推理;50 人需错峰使用
推荐1 至 2 张 48G 显存显卡32B 量化语言模型与识别模型同时常驻,50 人基本并发
过度配置8 卡整机或训练用集群超出本项目教学需要,二期不做训练即无此需求

不做训练也就不需要训练用显卡集群、标注工具与标注人力,这是二期成本能够控制住的主要原因。模型迭代很快,以上为二期规划时的可用选型,正式部署前按当时的最新稳定版本与授权条款复核。开源模型的商用授权范围需逐个确认后写入交付清单。


评论