首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >既然不是“检查点”,那么恢复TensorFlow 2.0训练的标准崩溃恢复方法是什么?

既然不是“检查点”,那么恢复TensorFlow 2.0训练的标准崩溃恢复方法是什么?
EN

Stack Overflow用户
提问于 2019-12-29 06:10:52
回答 1查看 63关注 0票数 1

要在崩溃后恢复训练,不仅必须恢复模型,还必须恢复进入model.fit(...)过程状态的所有对象和参数。

在我费心编写实现fitting对象的keras代码之前,我想知道用于崩溃恢复的标准方法(如果有的话)是什么,以便从中断的地方恢复TensorFlow 2.0训练。

还是有人真的填补了TensorFlow对象模型中的这个明显的漏洞?

EN

回答 1

Stack Overflow用户

发布于 2019-12-31 08:30:19

tf.keras.Model.fit()进程设置检查点的规范方法是ModelCheckpoint回调。

其用法类似于:

代码语言:javascript
复制
mode.fit(..., callbacks=[tf.keras.callbacks.ModelCheckpoint(checkpoint_dir)]

保存的检查点是在每个训练周期结束时默认生成的,它不仅包括模型的体系结构和权重值,还包括训练状态。如果你感兴趣,你可以研究它的源代码here。保存的训练状态包括

对于优化程序和权重变量值(对于有状态优化器,如Adam),可以使用损失和度量configuration

这些是否涵盖了您脑海中的所有训练状态?

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/59515290

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档