要在崩溃后恢复训练,不仅必须恢复模型,还必须恢复进入model.fit(...)过程状态的所有对象和参数。
在我费心编写实现fitting对象的keras代码之前,我想知道用于崩溃恢复的标准方法(如果有的话)是什么,以便从中断的地方恢复TensorFlow 2.0训练。
还是有人真的填补了TensorFlow对象模型中的这个明显的漏洞?
发布于 2019-12-31 08:30:19
对tf.keras.Model.fit()进程设置检查点的规范方法是ModelCheckpoint回调。
其用法类似于:
mode.fit(..., callbacks=[tf.keras.callbacks.ModelCheckpoint(checkpoint_dir)]保存的检查点是在每个训练周期结束时默认生成的,它不仅包括模型的体系结构和权重值,还包括训练状态。如果你感兴趣,你可以研究它的源代码here。保存的训练状态包括
对于优化程序和权重变量值(对于有状态优化器,如Adam),可以使用损失和度量configuration
这些是否涵盖了您脑海中的所有训练状态?
https://stackoverflow.com/questions/59515290
复制相似问题