高等教育领域数字化综合服务平台
云上高博会服务平台 高校科技成果转化对接服务平台 大学生创新创业服务平台 登录 | 注册
|
搜索
搜 索
  • 综合
  • 项目
  • 产品
日期筛选: 一周内 一月内 一年内 不限
融合架构的高时效可扩展大数据分析平台
大数据应用的多样化 需要的计算模型、数据模型多样化; 目前每类模型需要单独的开源系统来支持(如HDFS、HBase、Neo4j、MongoDB,Flink,Spark,Tensorflow等)。 多系统导致大数据分析平台非常复杂、效率低下。研究目标:研究和开发面向新型多计算模型融合架构的、高时效、可扩展的新 一代大数据分析支撑系统与工具平台FAST(Fusion-Architecture, Scalable, Time-efficient big data analysis platform)。针对目前大数据分析平台复杂、效率低下的痛点,该系统具有三个 方面的优势:首先,这套系统采用融合架构,一方面实现关系、图、键 值、文档等多种数据模型的高效融合,另一方面实现批处理计算、流计 算的深度融合,并可以通过SQL扩展语言来进行多模型的统一查询,实现高效的跨模型查询。其次,对于复杂系统来说,时效性非常重要,这 套系统采用融合架构提高效率是实现高时效的基础,更重要的是,我们 对大数据分析从数据到用户进行了端到端的全栈时效优化。最后,对于 大数据应用来说,系统扩展性非常重要,本系统在资源层、存储层和计 算层进行了全面的扩展性优化。下面在融合架构、高时效和可扩展这三 个方面,分别详细介绍FAST系统的三个主要亮点。融合架构FAST系统的第一个亮点是融合架构,我们在技术方面的创新主要包 括多数据模型融合和多计算模型融合两方面。多数据模型融合:设计和研发了多模型数据管理与查询引擎,支持关系、图、键值、 文档等多种数据模型,实现了查询解析、查询优化、元数据管理、数据 分布等功能,将多种数据模型进行统一管理和深度融合。同时扩展了SQL语言,通过统一的查询接口支持对关系、键值、图、文档等数据进行独立访问或者跨模型查询。经过试验,多模型数据融合查询,比Spark 2.3.4的查询时间能平均减少70.7%。目前spark等现有系统还需要手工编程方式来实现跨模型查 询,所以FAST系统在易用性上也表现良好,降低使用门槛,提高开发效率。多计算模型融合:在计算层实现了最常见的批处理计算和流计算深度融合,批流融合的核心方法是在系统内部实现批和流的统一表达,批是对有限数据集 的运算,流是对无限数据流的计算,我们设计了UCollection结构对批和 流数据进行统一表达,通过识别的bounded标志,来确定是批、流、或批流融合。有了统一表达,可以开展一系列融合优化来提升系统性能。 并且对上通过Unified API统一用户的批、流接口,实现二者在编程范式上的统一表达。对于批流混合的计算,融合架构系统的查询延迟比Flink 1.4.2能减少57%,吞吐量平均可以提升到6.72倍。高时效FAST系统的第二个亮点是高时效,即缩短大数据分析的时间消耗, 提高效率。由于大数据分析平台是一个非常复杂的系统,为了做到高时效,系统不能存在性能短板,因此需要对大数据分析的整个过程进行端到端的全栈时效优化。如图中所示,自下而上,需要在多模态存储、批流融合、机器学习、人工操作各层都进行优化。对于多模态存储,面向应用负载和异构硬件特征进行自适应优化;对于批流融合计算,在统一表达基础上,进行系列融合优化技术, 包括DAG优化、迭代优化、部署优化、操作符优化等;在机器学习层面,进行模型优化、消息优化、梯度优化、概率优化 等来提高时效;而且我们也考虑到大数据分析过程中用户人工操作的时效性问题, 通过智能地进行大数据分析方法和模型的推荐,来缩减人工操作的 时间。可扩展FAST系统的第三个亮点是可扩展,由于大数据应用规模很大,数据增速快,对系统可扩展性的要求非常高,为此我们在系统的资源层、 存储层和计算层进行了全面的扩展性优化。在资源层,系统都部署在云计算的虚拟化资源之上,利用了云计算资源的弹性机制进行系统扩展。并在系统中实现了可伸缩调整模块, 能实时监控软硬件系统的状态,按照应用需求来自适应地进行弹性伸缩。在存储层,分布式存储系统扩展性的关键在于分布式共识和一致性 协议(Raft),因此提出了KV-Raft、vRaft等进行Raft的扩展优化。在计算层,我们扩展了机器学习模型的参数规模,使系统可以支持 到百亿级别的超大规模机器学习模型训练,并且性能方面有明显提 升。亮点成果:融合架构大数据分析平台目前已经在阿里巴巴双十一进行示范应用。 从2020年11月10日至11月16日一周的时间,在阿里的生产环境中,研发 的系统一直连续稳定运行,基于淘宝和天猫的实际用户信息进行大数据 分析,综合运用了本系统的存储、计算、机器学习等多个模块的能力, 累计进行了184亿件商品推荐。同时在双十一期间,基于智能交互向导技术,也面向电子商务应用 的卖家提供了“生意参谋”应用,基于大数据分析,帮助卖家分析产品 销量变化的原因,以及促销的有效手段等。
中国人民大学 2021-04-10
基于大数据分析的小基站开关控制方法
本发明公开了一种基于大数据分析的小基站开关控制方法,包括:采集场景信息步骤;数据预处理步骤;提取特征步骤;选择并训练模型步骤;预测步骤。本发明利用特殊场景下时刻表以及小基站接入人数的历史记录,建立数学模型,预测未来小基站内的待服务人数,根据待服务人数去控制小基站的开关,达到节能、减少基站间干扰的目的。在建立数学模型的过程中,本方法结合数据挖掘和机器学习,提高了预测的准确率和系统的实用性。
东南大学 2021-04-11
融合架构的高时效可扩展大数据分析平台
研究背景:  大数据应用的多样化  需要的计算模型、数据模型多样化;  目前每类模型需要单独的开源系统来支持(如HDFS、HBase、Neo4j、MongoDB,Flink,Spark,Tensorflow等)。  多系统导致大数据分析平台非常复杂、效率低下。 研究目标: 研究和开发面向新型多计算模型融合架构的、高时效、可扩展的新 一代大数据分析支撑系统与工具平台FAST(Fusion-Architecture, Scalable, Time-efficient big data analysis platform)。 针对目前大数据分析平台复杂、效率低下的痛点,该系统具有三个  方面的优势:首先,这套系统采用融合架构,一方面实现关系、图、键  值、文档等多种数据模型的高效融合,另一方面实现批处理计算、流计  算的深度融合,并可以通过SQL扩展语言来进行多模型的统一查询,实现高效的跨模型查询。其次,对于复杂系统来说,时效性非常重要,这  套系统采用融合架构提高效率是实现高时效的基础,更重要的是,我们  对大数据分析从数据到用户进行了端到端的全栈时效优化。最后,对于  大数据应用来说,系统扩展性非常重要,本系统在资源层、存储层和计  算层进行了全面的扩展性优化。下面在融合架构、高时效和可扩展这三  个方面,分别详细介绍FAST系统的三个主要亮点。 融合架构 FAST系统的第一个亮点是融合架构,我们在技术方面的创新主要包  括多数据模型融合和多计算模型融合两方面。 多数据模型融合: 设计和研发了多模型数据管理与查询引擎,支持关系、图、键值、  文档等多种数据模型,实现了查询解析、查询优化、元数据管理、数据  分布等功能,将多种数据模型进行统一管理和深度融合。同时扩展了SQL语言,通过统一的查询接口支持对关系、键值、图、文档等数据进行独立访问或者跨模型查询。 经过试验,多模型数据融合查询,比Spark 2.3.4的查询时间能平均减少70.7%。目前spark等现有系统还需要手工编程方式来实现跨模型查 询,所以FAST系统在易用性上也表现良好,降低使用门槛,提高开发效率。 多计算模型融合: 在计算层实现了最常见的批处理计算和流计算深度融合,批流融合的核心方法是在系统内部实现批和流的统一表达,批是对有限数据集  的运算,流是对无限数据流的计算,我们设计了UCollection结构对批和  流数据进行统一表达,通过识别的bounded标志,来确定是批、流、或批流融合。有了统一表达,可以开展一系列融合优化来提升系统性能。 并且对上通过Unified API统一用户的批、流接口,实现二者在编程范式上的统一表达。对于批流混合的计算,融合架构系统的查询延迟比Flink 1.4.2能减少57%,吞吐量平均可以提升到6.72倍。 高时效 FAST系统的第二个亮点是高时效,即缩短大数据分析的时间消耗,  提高效率。由于大数据分析平台是一个非常复杂的系统,为了做到高时效,系统不能存在性能短板,因此需要对大数据分析的整个过程进行端到端的全栈时效优化。如图中所示,自下而上,需要在多模态存储、批流融合、机器学习、人工操作各层都进行优化。 对于多模态存储,面向应用负载和异构硬件特征进行自适应优化; 对于批流融合计算,在统一表达基础上,进行系列融合优化技术, 包括DAG优化、迭代优化、部署优化、操作符优化等; 在机器学习层面,进行模型优化、消息优化、梯度优化、概率优化 等来提高时效; 而且我们也考虑到大数据分析过程中用户人工操作的时效性问题,  通过智能地进行大数据分析方法和模型的推荐,来缩减人工操作的  时间。 可扩展 FAST系统的第三个亮点是可扩展,由于大数据应用规模很大,数据增速快,对系统可扩展性的要求非常高,为此我们在系统的资源层、  存储层和计算层进行了全面的扩展性优化。 在资源层,系统都部署在云计算的虚拟化资源之上,利用了云计算资源的弹性机制进行系统扩展。并在系统中实现了可伸缩调整模块,  能实时监控软硬件系统的状态,按照应用需求来自适应地进行弹性伸缩。 在存储层,分布式存储系统扩展性的关键在于分布式共识和一致性 协议(Raft),因此提出了KV-Raft、vRaft等进行Raft的扩展优化。 在计算层,我们扩展了机器学习模型的参数规模,使系统可以支持  到百亿级别的超大规模机器学习模型训练,并且性能方面有明显提  升。 亮点成果: 融合架构大数据分析平台目前已经在阿里巴巴双十一进行示范应用。  从2020年11月10日至11月16日一周的时间,在阿里的生产环境中,研发 的系统一直连续稳定运行,基于淘宝和天猫的实际用户信息进行大数据 分析,综合运用了本系统的存储、计算、机器学习等多个模块的能力, 累计进行了184亿件商品推荐。 同时在双十一期间,基于智能交互向导技术,也面向电子商务应用  的卖家提供了“生意参谋”应用,基于大数据分析,帮助卖家分析产品  销量变化的原因,以及促销的有效手段等。
中国人民大学 2021-05-09
开封市政务数据分析和可视化系统
河南大学软件学院依托开封市大数据与人工智能研究院,开发“开封市政务数据分析和可视化系统”,助力疫情防控。 该系统针对开封市各县区、各社区每日产生海量的文本数据,通过自然语言理解等人工智能技术手段进行数据分析,让采集的数据能够进行自动比对、分析、研判,生成可视化分析图,及时准确将结果以可视化的形式直观展现出来,以更精准的数据为打赢疫情防控攻坚战提供保障,对开封市疫情防控工作提供有力的决策支持。
河南大学 2021-04-11
技术需求、物联网可视化连接,大数据分析
物联网可视化连接,大数据分析
山东中拓信息科技有限公司 2021-06-15
辽宁大学舆情大数据系统
系统重点解决舆情数据分析中可视化舆情数据采集、存储和分析方法问题。系统提供可视化舆情数据采集方法,解决了用户定义数据采集模板易用性问题。系统采用主流的hadoop系统作为存储系统,解决了系统可用性问题。系统实现了多种舆情数据分析算法,实现了舆情报告辅助生成功能,能够有效的协助舆情分析人员工作。系统数据采集吞吐量、数据存储、计算能力均具有良好的扩展性。
辽宁大学 2021-04-11
基于多源异构的新冠肺炎疫情数据分析技术
南京工业大学计算机科学与技术学院史本云教授团队联合香港浸会大学计算机科学系与中国疾病预防控制中心寄生虫病预防控制所(国家热带病研究中心)共建的智能化疾病监控联合实验室,及时搜集疫情相关信息,追踪相关数据,运用多源异构数据驱动的传染病学模型和分析方法,针对武汉(新冠肺炎发源地)、北京、天津(京津冀地区)、深圳(粤港澳大湾区)、杭州和苏州(长三角经济区)6座典型城市,开展了新冠肺炎疫情的回顾性分析和趋势预判,精准评估了不同复工场景下的疫情风险和经济损失。该研究针对新冠肺炎疫情发展期、控制期和恢复期的不同阶段,以及不同城市的传播特点(本地传播为主/输入病例为主),综合考虑了各个城市内不同年龄段的人口分布和不同人群(如学生、上班族和老人)的接触强度、接触时长等,设计了居家场所、学校场所、工作场所和公共场所4种主要接触场景。通过结合城市间的人口流动数据,构建了数据驱动的传染病动力学模型,对不同城市不同干预手段下的疫情走势进行了评估。在此基础上,研究人员结合不同城市的GDP增长预期和产业结构,基于对未来数日各城市疫情走势的研判,对下一阶段有序推动恢复正常生产提出了若干建议并进行了相应的经济损失评估。据悉,该研究成果和建议已经通过国务院参事提交国家相关部门。
南京工业大学 2021-04-10
基于高性能计算集群机器学习的交通大数据分析系统
本平台实现交通数据的可视化、预测、关联性分析
中山大学 2021-04-10
基于大数据分析技术的眼病筛查与辅助诊断研究
北京工业大学 2021-04-14
基于大数据分析技术小于胎龄儿的预测与干预模型
北京工业大学 2021-04-14
首页 上一页 1 2 3 4 5 6
  • ...
  • 120 121 下一页 尾页
    热搜推荐:
    1
    云上高博会企业会员招募
    2
    63届高博会于5月23日在长春举办
    3
    征集科技创新成果
    中国高等教育学会版权所有
    北京市海淀区学院路35号世宁大厦二层 京ICP备20026207号-1