面试了8家公司,他们问了我这些机器学习标题......
作者头像
  • 2020-03-10 14:06:43 5

【导读】作者在过去一年中在印度寻找与数据迷信、机器学习及深度学习相关的工作机会。在求职过程中,他经历了多家不同类型的公司,包括初创公司、服务公司和产品公司。通过这次经历,作者希望能为其他求职者提供一些实用的参考。

自我介绍

我在机器学习领域拥有超过四年的经验,特别是在语音分析、文本分析和图像分析方面。我认为当前该领域的大多数工作都集中在文本分析(如自然语言处理)和图像分析(如计算机视觉)上。相比之下,语音或音频分析方面的工作机会较少。我目前的目标是寻找一个中高级职位,以便领导一个深度学习或机器学习团队开展有趣的项目。

面试问题汇总

公司一:全球性服务公司(20-25分钟)

  • 你在简历中提到构建过文档挖掘系统,具体做了哪些工作?是否使用主题建模(如LDA)技术进行文档聚类?如果有大量数据文件(包括PDF、文本文件、图像等),你将如何分类?如何处理扫描的PDF或图像文件?朴素贝叶斯为何称为“朴素”?请解释朴素贝叶斯分类器。什么是深度学习?深度学习与机器学习有何区别?

公司二:全球性服务公司(40-45分钟)

  • 如何在无监督学习中进行文件聚类?如何找到与特定查询相关的文件?解释TF-IDF技术。你认为TF-IDF在文件分类或聚类中的表现如何?你如何改进?什么是长短期记忆神经网络(LSTM)?解释其工作原理。什么是word2vec模型?解释Python中的可变对象和不可变对象。你用过哪些数据结构?

公司三:全球性产品和服务公司(40分钟)

  • 如何处理不平衡数据集的多类别分类问题?如何进行语音识别?如何表示中文或日文中的象形文字?如何设计聊天机器人?能否使用循环神经网络设计聊天机器人?如何选择最佳回复?解释支持向量机(SVM)如何学习非线性边界。

公司四:医疗初创公司(50分钟)

  • 什么是准确率和召回率?在医疗诊断中,哪一个更重要?解释准确率和召回率。如何绘制受试者工作特征曲线(ROC曲线)?ROC曲线下面积是什么意思?如何为多类别分类绘制ROC曲线?列举多类别分类的其他度量标准。什么是灵敏度和特异性?随机森林中的“随机”是什么意思?如何进行文本分类?如何确定已学会的文本?没有TF-IDF技术是否可行?你还能用机器学习做什么?当神经网络由线性节点组成时,它如何学习非线性边界?

公司五:亚马逊公司(50-55分钟)

  • 训练决策树时的参数是什么?在决策树的节点分割时的标准是什么?基尼系数和熵的计算公式是什么?决策树如何决定在哪个特征处分割?如何利用数学计算收集的信息?简述随机森林的优点。简述boosting算法。梯度提升算法(Gradient Boosting)的工作原理是什么?AdaBoost算法的工作原理是什么?SVM中使用的核函数有哪些?SVM的优化技术有哪些?SVM如何学习超平面?无监督学习有哪些算法?如何定义K-Means聚类算法中的K值?列举三种定义K值的方法。你还知道哪些聚类算法?解释DB-SCAM算法。简述分层凝聚聚类(Hierarchical Agglomerative Clustering)的工作原理。解释主成分分析(PCA)及其数学步骤。PCA有哪些缺点?卷积神经网络的工作原理是什么?解释反向传播。如何部署机器学习模型?能否用C++从头开始搭建模型?

公司六:全球服务巨头(50-55分钟)

  • Sigmoid函数的范围是什么?scikit-learn中实现逻辑回归的包是什么?标准正态分布的均值和方差是多少?你常用的Python数据结构有哪些?文本分类的方法有哪些?如何进行分类?解释TF-IDF技术及其缺陷,如何克服?什么是双词搭配(Bigrams)和三词搭配(Trigrams)?举例说明word2vec的应用。如何设计神经网络?如何实现“深度”?简述LSTM的工作原理。朴素贝叶斯分类器是什么?抛硬币的概率如何计算?如何获取Python列表中元素的索引?如何合并两个Pandas数据集?如何处理欺诈检测问题?决策树和随机森林哪个更好?逻辑回归和随机森林的区别是什么?决策树和随机森林哪个更适合处理分类问题?随机森林的优点是什么?

公司七:全球商业管理公司(25-30分钟)

  • 在不平衡数据集中,你会选择随机森林还是Boosting?为什么?你了解哪些Boosting技术?处理分类问题时,你会选择哪种监督学习模型?如何使用集成(Ensemble)技术?简述SVM的工作原理。什么是核函数?如何实现非线性回归?什么是Lasso回归和Ridge回归?

公司八:消费和服务型公司(60分钟)

  • 你在简历中提到过语音识别项目,具体怎么实现?什么是梅尔频率倒谱(MFCCs)?什么是高斯混合模型(GMM),如何实现聚类?期望最大化是什么?如何实现?GMM模型中的概率如何计算?在语音识别中如何执行MAP调整?谈谈I-vector技术。在分析语境时,主要因素是什么?JFA和I-vector的区别是什么?是否使用过PLDA I-vector技术?是否读过百度的Deep Speaker论文?如果有两个模型可供选择,你会根据什么标准选择?简述贝叶斯信息准则(BIC)和赤池信息量(AIC)的数学原理。如何处理MFCC特征向量矩阵中的数据丢失问题?如何进行语音识别?分类器是针对语音和音乐,还是语音和非语音的?深度神经网络如何应用于语音分析?

面试建议

在整个求职过程中,作者与25-30位专业人士进行了交流,总结出以下建议:

  • 简历很重要:在简历中详细列出你参与的项目、获得的MOOC课程证书或论文。简历是打动HR和面试官的关键。
  • 自信和热情:面试时要自信,并展示你的热情。这对创业公司和基于服务的公司尤为重要。
  • 不要急于回答:组织好答案后再回答,不清楚的问题可以向面试官询问。保持冷静。
  • 展示自己的项目:解释概念时,引用你已完成的项目,并熟悉简历中提到的技能和项目。
  • 展现经验:大多数情况下,面试官在寻找有经验的技术人才。如果你是新手,可以从自己完成的项目入手。
  • 谦虚倾听:保持谦逊,倾听面试官的意见。避免陷入不必要的争论,如R语言和Python的优劣之争。

希望以上内容能帮助你更好地准备面试,祝你求职成功!

    本文来源:图灵汇
责任编辑: :
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
面试他们这些机器标题学习公司
    下一篇