k8s使用Job执行任务失败了怎么办

小碗汤 · 2019-10-16 10:33:20 · 1176 次点击 · 预计阅读时间 1 分钟 · 大约8小时之前开始浏览

这是一个创建于 2019-10-16 10:33:20 的文章，其中的信息可能已经有所发展或是发生改变。

第一次，站长亲自招 Gopher 了>>>

Kubernetes 中使用 Job 和 CronJob 两个资源分别提供了一次性任务和定时任务的特性，这两种对象也使用控制器模型来实现资源的管理，我们在这篇文章来介绍Job执行如果失败了会怎么样呢？

修改job-fail.yaml，故意引入一个错误：

Never

如果将 restartPolicy 设置为 Never 会怎么样？下面我们实践一下，修改job-fail.yaml后重新启动。

运行 Job 并查看状态，可以看到Never策略的job，pod失败后，重新创建：

直到重新创建7个（spec.backoffLimit默认为6，即重试6次，共7个pod）pod都失败后，认为失败，job的status里会更新为Failed

当前 Completion 的数量为 0

查看 Pod 的状态：

可以看到有多个 Pod，状态均不正常。kubectl describe pod 查看某个 Pod 的启动日志：

日志显示没有可执行程序，符合我们的预期。

为什么 kubectl get pod 会看到这么多个失败的 Pod？

原因是：当第一个 Pod 启动时，容器失败退出，根据 restartPolicy: Never，此失败容器不会被重启，但 Job DESIRED 的 Pod 是 1，目前 SUCCESSFUL 为 0，不满足，所以 Job controller 会启动新的 Pod，直到 SUCCESSFUL 为 1。对于我们这个例子，SUCCESSFUL 永远也到不了 1，所以 Job controller 会一直创建新的 Pod，直到设置的数量，失败后pod不会自动被删除，为了终止这个行为，只能删除 Job，pod也会被同时删掉。

OnFailure

如果将 restartPolicy 设置为 OnFailure 会怎么样？下面我们实践一下，修改job-fail.yaml后重新启动。

Job 的 Completions Pod 数量还是为 0，看看 Pod 的情况：

这里只有一个 Pod，不过 RESTARTS 在不断增加，说明 OnFailure 生效，容器失败后会自动重启。

6次失败后，pod被删除：

同时更新job的status为失败，方便查看最终执行结果：

本公众号免费提供csdn下载服务，海量IT学习资源，如果你准备入IT坑，励志成为优秀的程序猿，那么这些资源很适合你，包括但不限于java、go、python、springcloud、elk、嵌入式、大数据、面试资料、前端等资源。同时我们组建了一个技术交流群，里面有很多大佬，会不定时分享技术文章，如果你想来一起学习提高，可以公众号后台回复【2】，免费邀请加技术交流群互相学习提高，会不定期分享编程IT相关资源。

扫码关注，精彩内容第一时间推给你

有疑问加站长微信联系（非本文作者）

本文来自：Segmentfault

感谢作者：小碗汤

查看原文：k8s使用Job执行任务失败了怎么办

入群交流（和以上内容无关）：加入Go大咖交流群，或添加微信：liuxiaoyan-s 备注：入群；或加QQ群：692541889

1176 次点击

加入收藏微博

赞

收入我的专栏

上一篇：采坑指南——k8s域名解析coredns问题排查过程

下一篇：云服务器使用docker搭建服务

技术交流

篇文章

重试

java

0 回复

添加一条新回复（您需要登录后才能回复没有账号？）

请尽量让自己的回复能够对别人有帮助
支持 Markdown 格式, **粗体**、~~删除线~~、`单行代码`
支持 @ 本站用户；支持表情（输入 : 提示），见 Emoji cheat sheet
图片支持拖拽、截图粘贴等方式上传

关注我

扫码关注领全套学习资料
加入 QQ 群：
- 192706294（已满）
- 731990104（已满）
- 798786647（已满）
- 729884609（已满）
- 977810755（已满）
- 815126783（已满）
- 812540095（已满）
- 1006366459（已满）
- 692541889
加入微信群：liuxiaoyan-s，备注入群
也欢迎加入知识星球 Go粉丝们（免费）

X

登录和大家一起探讨吧