数据湖的实施可以为分析所有类型的外部和内部数据,提供巨大的灵活性—必需具备三大要素。 格雷普韦恩,德克萨斯州——像任何其他工具或技术一样,数据湖是一种存储库和处理引擎,有它的优点和缺点。它的著名优点之一是,可以在不牺牲数据格式的情况下,摄取数据,为数据科学家提供更大的灵活性。
“将数据湖看作为你的疑问开发环境:你不知道你的疑问是什么,” Nick Heudecker说,他是Gartner的分析师。数据湖让你探索你所不知道的,从一个疑问引发另一个疑问。 缺点?没有适当的技能、集成和数据治理,数据湖的实施会迅速成为数据管理的噩梦。
在最近举行的Gartner Business Intelligence and Analytics Summit 上,Heudecker在他的演讲中列举了健全的数据湖的三个特征。
技能
数据科学家是任何数据湖中的必要因素。“他们拥有较高的领域理解力,较低的IT技能,但是你雇佣他们是因为数据分析技能,”Heudecker说。但是数据科学家并不是实施数据湖所需的唯一技能。Heudecker还指出: 数据工程师,运用数据科学家的研究发现,并与业务部门紧密合作; 业务专家,提供上下文; 软件工程师,专注于数据湖实施的具体细节 平民数据科学家,并不是必需的,但可以作为数据科学家的补充,即使他们的技能不完全成熟,能够完全胜任这个职能。
“数据科学是一项团队任务,”Heudecker说。“如果你想要一个成功的数据湖,你必须拥有一个成功的团队。”
集成
IT部门需要考虑如何把数据——从内部,以及越来越多的外部来源——汇总到数据湖中,这就意味着将湖与IT基础设施的其他部分相集成。 这就要求正确的数据初始分类和索引,以及数据安全,Heudecker说。
此外,CIO还不得不考虑分析技术。一些数据湖技术——比如Hadoop——可能“不支持高并发性和多租户,”Heudecker说。“他们可能不适合你选择的商业智能平台或控制面板工具。” Heudecker认为,数据分析也可以在数据湖外部产生,比如使用MySQL,SQL Server或MongoDB数据库。
数据治理和数据质量 数据治理和数据质量是确保分析正确的关键,但它们的标准和应用与传统环境中有所差别。太多可能会妨碍数据湖的分析发现;太少可能会给企业带来麻烦。
为了找到合适的界限,Heudecker推荐IT部门考虑数据基数,或数据与其他数据之间的关联,以及数据沿袭,或者“你是如何处理数据的,数据从何而来,谁改动了它,为什么,”他说。“我认为你可以放弃其他元素的治理,至少当你处于数据湖环境中。” Heudecker认为数据质量是数据湖中的“重大挑战”。他说,IT部门应该创建目录和“社交化”数据集,将其作为员工之间的一种沟通方式,它们的相关数据质量和它们的用处。
在实施数据湖之前,IT部门应该考虑业务的目标,数据湖将如何帮助实现这些目标,以及是否拥有必要的技能。 “你不必将数百万美元投资到这个基础设施。你可以从云中开始,你可以从简便和免费的工具开始,如果你今天没有数据科学团队,你可以在实施数据湖的同时打造这一团队,”Heudecker说。
好文章,需要你的鼓励
英特尔携手戴尔以及零克云,通过打造“工作站-AI PC-云端”的协同生态,大幅缩短AI部署流程,助力企业快速实现从想法验证到规模化落地。
意大利ISTI研究院推出Patch-ioner零样本图像描述框架,突破传统局限实现任意区域精确描述。系统将图像拆分为小块,通过智能组合生成从单块到整图的统一描述,无需区域标注数据。创新引入轨迹描述任务,用户可用鼠标画线获得对应区域描述。在四大评测任务中全面超越现有方法,为人机交互开辟新模式。
阿联酋阿布扎比人工智能大学发布全新PAN世界模型,超越传统大语言模型局限。该模型具备通用性、交互性和长期一致性,能深度理解几何和物理规律,通过"物理推理"学习真实世界材料行为。PAN采用生成潜在预测架构,可模拟数千个因果一致步骤,支持分支操作模拟多种可能未来。预计12月初公开发布,有望为机器人、自动驾驶等领域提供低成本合成数据生成。
MIT研究团队发现,AI系统无需严格配对的多模态数据也能显著提升性能。他们开发的UML框架通过参数共享让AI从图像、文本、音频等不同类型数据中学习,即使这些数据间没有直接对应关系。实验显示这种方法在图像分类、音频识别等任务上都超越了单模态系统,并能自发发展出跨模态理解能力,为未来AI应用开辟了新路径。