大数据_惠州站长网

开源ETL工具kettle系列之常见问题

所属栏目：[大数据] 日期：2021-01-18 热度：109

摘要本文主要介绍使用kettle设计一些ETL任务时一些常见问题，这些问题大部分都不在官方FAQ上，你可以在kettle的论坛上找到一些问题的答案问题 Join 我得到A 数据流（不管是基于文件或数据库），A包含field1,field2,field3 字段，然后我还有一个B数据流，[详细]
开源大数据查询分析引擎现状

所属栏目：[大数据] 日期：2021-01-18 热度：142

文|叶蓬【按：此文是与我的《基于大数据分析的安全管理平台技术研究及应用》同期发表在内刊上的我的同事们的作品，转载于此。这些基础性的研究和测试对比分析，对于我们的BDSA技术路线选定大有帮助。】引言大数据查询分析是云计算中核心问题之一，自从G[详细]
【数位DP】HDU3565-Bi-peak Number

所属栏目：[大数据] 日期：2021-01-18 热度：165

题目链接：http://acm.split.hdu.edu.cn/showproblem.php?pid=3565 Problem Description A peak number is defined as continuous digits {D0,D1 … Dn-1} (D0 0 and n = 3),which exist Dm (0 m n - 1) satisfied Di-1 Di (0 i = m) and Di Di+1 (m = i n[详细]
LightOJ1282 Leading and Trailing 大数取首尾

所属栏目：[大数据] 日期：2021-01-18 热度：102

任何一个数都可以转换为10^k，k是一个小数，k的整数部分决定了这个数的位数，小数部分决定了每一位的值，根据此可以快速找到前三位。通过快速幂取模可以快速找到后三位。题目链接：http://acm.hust.edu.cn/vjudge/problem/26992 #pragma comment(linker,[详细]
数据处理之——data.table

所属栏目：[大数据] 日期：2021-01-18 热度：185

副标题#e# data.table简介关于 R 中的数据处理，我们接着介绍 data.table 包。上期我们介绍的 dplyr 有类似于sql的一套数据处理的语法，而 data.table 则有着它自己的一套语法，它能处理几乎所有 dplyr 可以处理的数据，而且代码量更少，效率更高，特别是[详细]
日均请求量百亿级数据处理平台的容器云实践

所属栏目：[大数据] 日期：2021-01-18 热度：54

from:?http://geek.csdn.net/news/detail/97887 声明：本文为CSDN原创投稿文章，未经许可，禁止任何形式的转载。? 作者：袁晓沛，目前在七牛云的主要工作是基于容器平台构建分布式应用，借助容器的优势，实现大规模分布式应用的自动化运维以及高可用，以Pa[详细]
如何计算文档相似性

所属栏目：[大数据] 日期：2021-01-18 热度：101

最近课题需要，整理一下文档相似性的一些研究，主要是参考知乎上面的回答和52nlp的相关文章。以备后期综述使用。具体还需要好好细读链接。主要思路 01/one hot representation，BOW+tf-idf+LSI/LDA体系. docsim方法：gensim包，使用corpora.Dictionary(te[详细]
关联规则挖掘——Apriori算法

所属栏目：[大数据] 日期：2021-01-18 热度：113

前言大二的时候，一个老师为了勾起我们对数据挖掘的兴趣，老是问我们这个问题：你们知道超市为什么要把啤酒跟尿布放在一起吗？但是从来没告诉我们答案。现在，很多人都听过这个问题，觉得很平常，但是那时的我真觉得挺神奇的。直到后来，了解了关联规则挖[详细]
在「不稀缺」的商业世界，如何挖掘稀缺的资源？

所属栏目：[大数据] 日期：2021-01-18 热度：98

副标题#e# 要生存壮大，就要找到新的稀缺资源，并且想尽办法掌握在自己手中。文 | 曲凯编者按：本文来源42章经（ID：MyFortyTwo），一家生产原创优质内容的科技媒体，誓同有趣、有料、有企图心的灵魂共成长。 “Technology increases access to what is[详细]
HHUOJ 1003 数字整除（模拟大数整除）

所属栏目：[大数据] 日期：2021-01-18 热度：140

1003: 数字整除时间限制: 1 Sec??内存限制: 128 MB 提交: 10??解决: 7 题目描述定理：把一个至少两位的正整数的个位数字去掉，再从余下的数中减去个位数的5倍。当且仅当差是17的倍数时，原数也是17的倍数。例如，34是17的倍数，因为3-20=-17是17的倍数[详细]
【报名】工业大数据深度挖掘应用与技术实现——清华大数据“技术

所属栏目：[大数据] 日期：2021-01-18 热度：144

大数据与工业数据的结合，使制造过程能进行分析、推理、判断、构思和决策等。通过人与机器的合作共事，去扩大、延伸和部分地取代人类专家在制造过程中的脑力劳动。它把制造自动化的概念更新，扩展到柔性化、智能化和高度集成化。然而，这一切又都必须服从[详细]
阶乘的精确值（大数）

所属栏目：[大数据] 日期：2021-01-18 热度：154

首先确定阶乘的位数。我们知道整数n的位数的计算方法为：log10(n)+1 故n!的位数为log10(n!)+1 ? 如果要求出n!的具体值，对很大的n（例如n=1000000）来说，计算会很慢，如果仅仅是求阶乘的位数，可以用斯特林(Stirling)公式求解 ? 斯特林（Stirling）公式[详细]
LSHForest进行文本相似性计算

所属栏目：[大数据] 日期：2021-01-18 热度：56

LSH Forest: Locality Sensitive Hashing forest,局部敏感哈希森林，是最近邻搜索方法的代替，排序实现二进制搜索和32位定长数组和散列，使用hash家族的随机投影方法近似余弦距离。随机投影树，对所有的数据进行划分，将每次搜索与计算的点的数目减小到[详细]
【R语言数据处理】一步一步来分析数据之不知哪位收集的淘宝推荐

所属栏目：[大数据] 日期：2021-01-18 热度：106

文件名：淘宝最全年货大促特价整理数据我先传百度云了，分享一下，你们看了就知道是什么样子的了，我改了一下名字，文件名：tbtj.xls 360云盘：https://yunpan.cn/cMTiN2Lyk5MpK 访问密码 d2cc 百度云：http://pan.baidu.com/s/1hsBHuGO 我们先来看下里面[详细]
DB、ETL、DW、OLAP、DM、BI关系结构图

所属栏目：[大数据] 日期：2021-01-18 热度：193

（1）DB/Database/数据库——这里一般指的就是OLTP数据库，在线事物数据库，用来支持生产的，比如超市的买卖系统。DB保留的是数据信息的最新状态，只有一个状态！比如，每天早上起床洗脸照镜子，看到的就是当时的状态，至于之前的每天的状态，不会出现的你[详细]
R语言-数据处理

所属栏目：[大数据] 日期：2021-01-18 热度：104

Reading Data 读取表格数据的函数read.table()以及read.csv() readLines()用于逐行读取文本文件 source()读取R代码的重要函数 dget()用来读取R代码文件 load()和unserialize()用于把二进制对象读入R Writing Data write.table() writeLines() dump() dput([详细]
简单粗暴的“大数据“解决方案

所属栏目：[大数据] 日期：2021-01-18 热度：188

这里说“大数据”确实有点哗众取宠，但确确实实是解决一些大数据量的情况。比如常用的布隆过滤器(BloomFilter)、常用的文本相似比较算法SimHash等，这里介绍的都是看上去是简单粗暴的方法，但当你深入了解后你就会发现什么叫简约而不简单，掌握这些常用的[详细]
【重！磅！干！货

所属栏目：[大数据] 日期：2021-01-17 热度：173

副标题#e# 查看之前文章请点击右上角，关注并且查看历史消息，还可以在文章最后评论留言。谢谢您的支持！回复【文本挖掘】或者【点击阅读原文】获取链接与代码附录一、功能概述 ? ? ? ?关键词词频网络图是以股票论坛、个股新闻、研究报告三个网站作[详细]
51Nod－1116－K进制下的大数

所属栏目：[大数据] 日期：2021-01-17 热度：91

ACM模版描述题解这里我们通过样例可以发现 A1A 的数位和是21，刚好是 K-1 的倍数，所以我们不妨多举几组数据测试一下，发现竟然都符合这个规律(￣┰￣*)，那么AC就不远了。可是这里需要强调的是，K的最小值，如果K清一色的都是从2开始枚举，那么不用想[详细]
开源ETL工具kettle系列之在应用程序中集成

所属栏目：[大数据] 日期：2021-01-17 热度：58

副标题#e# 摘要本文主要讨论如何在你自己的Java应用程序中集成Kettle 集成如果你需要在自己的Java应用程序中集成Kettle,一般来说有两种应用需求，一种是通过纯设计器来设计ETL转换任务，然后保存成某种格式，比如xml或者在数据库中都可以，然后自己调用程[详细]
开源ETL工具kettle系列之增量更新设计

所属栏目：[大数据] 日期：2021-01-17 热度：173

前言 ETL中增量更新是一个比较依赖与工具和设计方法的过程，Kettle中主要提供Insert / Update 步骤，Delete 步骤和Database Lookup 步骤来支持增量更新，增量更新的设计方法也是根据应用场景来选取的，虽然本文讨论的是Kettle的实现方式，但也许对其他工具[详细]
开源ETL工具kettle系列之动态转换

所属栏目：[大数据] 日期：2021-01-17 热度：132

副标题#e# 摘要本文主要讨论使用Kettle来设计一些较为复杂和动态的转换可能使用到的一些技巧，这些技巧可能会让你在使用Kettle的时候更加容易的设计更强大的ETL任务。动态参数的传递 Kettle 在处理运行时输入参数可以使用JavaScript 来实现，大部分工作只[详细]
开源ETL工具kettle系列之建立缓慢增长维

所属栏目：[大数据] 日期：2021-01-17 热度：166

副标题#e# 摘要本文主要介绍使用kettle 来建立一个Type 2的Slowly Changing Dimension 以及其中一些细节问题 Kettle 简介 Kettle 是一个强大的，元数据驱动的ETL工具被设计用来填补商业和IT之前的差距，将你公司的数据变成可增长的利润. 我们先来看看Kettl[详细]
大数据分析公司Kentik完成230万美元B轮融资

所属栏目：[大数据] 日期：2021-01-17 热度：128

点击上方蓝色字体关注。您还可以搜索公众号“ D1net”选择关注D1net旗下的各领域（云计算，数据中心，大数据，CIO，企业协作，网络数通，信息安全，企业移动应用，系统集成，服务器，存储，呼叫中心，视频会议，视频监控等）的子公众号。 ======= 数据的[详细]
互联网金融之量化投资深度文本挖掘——附源码文档

所属栏目：[大数据] 日期：2021-01-17 热度：151

?? 【重！磅！干！货[详细]

2441

首页

尾页