收藏本页 打印 放大 缩小
0

数人云联合清华OCP实验室共建深度学习平台

发布时间:2016-11-14 19:30:28    作者:    来源:中国保险报·中保网

中保网讯【记者 苏洁】 近日,企业云计算实践者数人云与清华大学交叉信息研究院开放计算项目实验室(OCP实验室)合作共建深度学习平台,该平台通过数人云操作系统实现GPU资源共享,利用Docker技术交付深度学习的运行环境,让深度学习项目组师生可以更加灵活地使用GPU资源,并解决深度学习环境部署繁琐的问题。

深度学习算法的计算性能依赖强大的GPU计算能力,为了尽可能提高GPU资源利用率,数人云利用Mesos将GPU资源汇聚成资源池实现资源共享,并借用Docker交付深度学习的运行环境。

深度学习平台利用容器化深度学习组件,同时,借助数人云搭建GPU集群,共享GPU资源。最终,为用户提供了可一条命令部署深度学习环境的平台。在节点内部,数人云利用nvidia-docker帮助容器内部的程序调用外面主机上的CUDA Driver。CUDA Driver及GPU Driver安装在外部Host上,CUDA Toolkit,及其它深度学习组件及用户应用程序运行在Docker容器中。这样既能快速配置环境,又保证了HOST不受用户应用程序污染。