×
请登录
账号
密码
登录 Use it
博客
随笔
网盘
建站
资源
古文赏析
标签
毒鸡汤
登录
注册
微博广告策略工程架构体系演进
分享嘉宾:李铁牛 新浪微博 编辑整理:崔媛媛 内容来源:DataFun AI Talk 出品社区:DataFun 导读: 本次分享的主题为微博广告策略工程架构体系演进,将介绍微博广告在从 0 到 1,从 1 到 N 的过程中,微博广告架构是如何支持策略、算法、模型迭代的,包括以下几部分: 概述 微博 ....
star2017
博客
1年前
7337
0
Lucene 源码系列——Automaton 有穷自动机 (DFA)
Automaton 在介绍 Automation 类之前先介绍下有穷自动机的概念,有穷自动机分为确定型有穷自动机(DFA)跟不确定型有穷自动机(NFA)。由于本篇文章是为介绍 TermRangeQuery 作准备的,所以只介绍确定性有穷自动机。 确定型有穷自动机(Deterministic ....
star2017
博客
1年前
1205
0
Lucene 源码系列——工具类 FixedBitSet
FixedBitSet FixBitSet 类在 Lucene 中属于一个工具类(Util),它的其中一个用途用来存储文档号,用一个 bit 位来描述(存储)一个文档号。该类特别适合存储连续并且没有重复的 int 类型的数值。最好情况可以用 8 个字节来描述 64 个 int 类型的值。下面通过介绍 ....
star2017
博客
1年前
1533
0
Wide&Deep 算法理论与实践
背景 在 CTR 预估任务中,线性模型仍占有半壁江山。利用手工构造的交叉组合特征来使线性模型具有“记忆性”,使模型记住共现频率较高的特征组合,往往也能达到一个不错的 baseline,且可解释性强。但这种方式有着较为明显的缺点:首先,特征工程需要耗费太多精力。其次,因为模型是强行记住这些组合特征的, ....
star2017
博客
1年前
11168
0
xDeepFM 算法理论与实践
阅读原文 前言 今天为大家带来的是 2018 年由中科大、北邮、微软联合推出的 xDeepFM(eXtreme Deep Factorization Machine)模型[1],该模型的主要贡献在于,基于 vector-wise 的模式提出了新的显式交叉高阶特征的方法,并且与 DCN [2]一样,能 ....
star2017
博客
1年前
9759
0
Embedding 技术在推荐系统中的实践总结
作者:minwxwang,腾讯 PCG 应用研究员 当前主流的推荐系统中,embedding 无处不在,从一定意义上可以说,把 embedding 做好了,整个推荐系统的一个关键难题就攻克了。因此,本文总结了移动腾讯网推荐系统中的 embedding 技术实践,力图达到娱人娱己的目的。 什么是 em ....
star2017
博客
1年前
5080
0
所有机器学习项目都适用的检查清单
作者:Harshit Tyagi 编译:ronghuaiyang 导读 构建端到端机器学习项目的任务检查清单。 [图片] Image for post 我正在创建一系列有价值的项目,我想到了将我从别人那里学到的或在工作中开发的实践记录下来。在本博客中,我整理了在处理端到端 ML 项目时经常提到的任务 ....
star2017
博客
1年前
4821
0
基于知识图谱的问答系统入门—NLPCC2016KBQA 数据集
作者丨郭雅志 学校丨北京化工大学 研究方向丨 NLP、知识图谱、对话/问答系统 本人认为学习一样东西,直接上手跑实验是最有效提升的方法之一。看了那么多的理论介绍文章,抽象的说辞,最后还是似懂非懂。所以,直接上手数据集跑实验,与理论结合,能有更深刻的了解。同时也记录下学习 KBQA 的过程,也希望对同 ....
star2017
博客
1年前
9238
0
Lucene 源码系列——tvx tvd 索引文件
当设置了 TermVector 的域生成了倒排表以后,将文档的词向量信息写到。tvx(vector_index)跟。tvd(vector_data)文件中。 数据结构 .tvd 图 1: [图片] PackedIntsVersion PackedIntsVersion 描述了压缩使用的方式,当前版本 ....
star2017
博客
1年前
1215
0
知识蒸馏在推荐系统的应用
作者 | 张俊林@新浪微博 目录 知识蒸馏典型方法 知识蒸馏在推荐系统中的三个应用场景 知识蒸馏在三类推荐排序中的方法介绍 联合训练召回、粗排及精排模型的设想 随着深度学习的快速发展,优秀的模型层出不穷,比如图像领域的 ResNet、自然语言处理领域的 Bert,这些革命性的新技术使得应用效果快速提 ....
star2017
博客
1年前
4792
0
数据智能在二手车业务场景中的探索与沉淀 - 业务标签挖掘
导语:标签为用户提供了一种新的检索方式,用户和信息通过标签进行关联,信息的标签化、行为的标签化,在提供个性召回能力的同时,也有助于帮我梳理和挖掘业务品类的特征,做相关业务属性的聚合。 背景 当下全连接的信息场景,所有对于有助于连接转化效率提升的内容和考虑尤为重要,这就要求我们在实际业务场景中,结合用 ....
star2017
博客
1年前
10685
0
Lucene 源码系列——fdx fdt 索引文件
当 STORE.YES 的域生成了倒排表以后,将文档的域值信息写入到。fdt(field data)、.fdx(field index)文件中。 数据结构 .fdt 图 1: [图片] ChunkSize ChunkSize 用来描述压缩存储域值信息的方式,后面会详细介绍。 PackedIntsVe ....
star2017
博客
1年前
1271
0
为什么 L2 正则化能够缓解模型过拟合并使得模型更简单
公众号:月来客栈,欢迎关注!微信: nulls8 [图片] 模型产生过拟合的现象表现为:在训练集上误差较小,而在测试集上误差较大。并且笔者还说到,之所以产生过拟合现象是由于训练数据中存在一定的噪音,而我们为了尽可能的做到拟合每一个样本点(包括噪音),往往就会使用复杂的模型。最终使得训练出来的模型很大 ....
star2017
博客
1年前
8242
0
Spark 三种提交模式:Standalone | yarn-client | yarn-cluster
[图片] 一。Standalone 模式基于 spark 自己的 Master-Worker 集群。 就是之前的 spark-submit 提交的方式这里不再详细叙述。如果不清楚可以看这篇文章 如果要切换成第二种,第三种模式。将之前的 submit 脚本添加上--master 参数 设置为 yarn ....
star2017
博客
1年前
2517
0
机器学习中的特征工程总结!
[图片] 译者:张峰 ,Datawhale 成员 特征工程 传统编程的关注点是代码。在机器学习项目中,关注点变成了特征表示。也就是说,开发者通过添加和改善特征来调整模型。“Garbage in, garbage out”。对于一个机器学习问题,数据和特征往往决定了结果的上限,而模型、算法的选择及优化 ....
star2017
博客
1年前
9134
0
淘系技术 | 极简而高效的沟通管理法
作者: 鲁佳(鹿迦) 世界上有两件最难的事:把别人的钱装进自己的口袋;把自己的思想装进别人的脑袋。 为什么沟通那么重要 谁都知道在工作中沟通是非常重要的,那大家有没有真正想过为什么沟通这么重要呢? 首先我们想想看,在你的日常工作时间分配上,“沟通”所用的时间占比多少呢?日常的会议、在钉钉上的讨论、处 ....
star2017
博客
1年前
4387
0
美团深度学习在搜索业务中的探索与实践
本文根据美团高级技术专家翟艺涛在 2018 QCon 全球软件开发大会上的演讲内容整理而成,内容有修改。 引言 2018 年 12 月 31 日,美团酒店单日入住间夜突破 200 万,再次创下行业的新纪录,而酒店搜索在其中起到了非常重要的作用。本文会首先介绍一下酒店搜索的业务特点,作为 O2O 搜索 ....
star2017
博客
1年前
10850
0
【布道师系列】杨健——30 天到 3 分钟的改变!下篇
上期回顾 《30 天到 3 分钟的改变!》系列主要讨论机器学习流程的三个阶段:数据获取和处理、模型训练和评估、模型部署和迭代。上期我们通过建模工具、算法和框架、高性能训练、管理特性重点介绍了模型训练相关的工具特性。本期将重点讨论模型部署和迭代! 模型部署和迭代 [图片]机器学习建模项目全流程 模型部 ....
star2017
博客
1年前
3799
0
推荐系统中模型训练及使用流程的标准化
文章作者:梁超 腾讯 高级工程师 编辑整理:Hoh Xil 内容来源:DataFun AI Talk 出品社区:DataFun [图片] 导读: 本次分享的主题为推荐系统中模型训练及使用流程的标准化。 在整个推荐系统中,点击率 ( CTR ) 预估模型是最为重要,也是最为复杂的部分。无论是使用线性模 ....
star2017
博客
1年前
11692
0
美团智能搜索模型预估框架 Augur 的建设与实践
[图片] 本文转载自美团技术团队。 1. 背景 在过去十年,机器学习在学术界取得了众多的突破,在工业界也有很多应用落地。美团很早就开始探索不同的机器学习模型在搜索场景下的应用,从最开始的线性模型、树模型,再到近两年的深度神经网络、BERT、DQN 等,并在实践中也取得了良好的效果与产出。 本文将与大 ....
star2017
博客
1年前
2761
0
1
...
405
406
407
...
465
本文目录
热门标签
广告位
热门文章
1.
如何学习Python数据科学(2018)
2.
SpringBoot2实践系列(六):集成监控模块Actuator详解
3.
31个与大数据有关的非常不错的资源和文章(附全链接)
4.
这可能是人工智能、机器学习和大数据领域覆盖最全的一份速查表
5.
微服务应用(十五):一台服务器重启导致Redis集群宕机所有业务不可用问题分析
6.
史上最全的“大数据”学习资源(上)
阿里云新老用户最新优惠
阿里云新老用户最新优惠
最新发布
1.
连接配置了SSL的达梦数据库
2.
修改jar里的配置文件
3.
linux定时工具crontab使用
4.
桌面看盘工具dstock V2.0发布
5.
Claude Code自动代码工具安装配置使用
6.
远程调试工具charles
最新评论
签到
?
签到
签到
签到,学习
签到