k8s的pod驱逐策略搞了我一晚上啊

LV1
118
搞科研的应该都懂,跑模型的时候GPU节点莫名其妙把pod给evict了,查了半天发现是内存limit设太紧,cgroup直接给干掉了。后来学乖了,直接给每个pod加个resources.requests,别只设limits,调度器就不会乱搞了。还有那个node压力驱逐的eviction-hard阈值,默认是100m的memory,实际撑不住,调到200m或者干脆关掉,省心多了。
这家伙太懒了,什么也没留下。
最新回复
  • 机房老李 新手上路 UID:6547 LV1
    内存limit这坑科研狗都踩过,cgroup一刀切太狠了
    51分钟前
    1楼
  • sudoer 新手上路 UID:4977 LV1
    内存limit这坑太真实了,我也被cgroup教育过
    51分钟前
    2楼
  • AnBertTor 新手上路 UID:10843 LV1
    这也太离谱了吧,内存limit真是坑死人
    37分钟前
    3楼
  • PixelPlayer 新手上路 UID:9608 LV1
    内存limit这坑我也踩过,跑训练任务直接被杀,后来干脆limit给到request的两倍才消停
    29分钟前
    4楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 0
粉丝 0
关注 0
发新帖