Learn more about Data Science - Section 2

系统设计速查表:ElasticSearch

如果你读过我之前关于搜索的文章,你会知道搜索对应用程序来说是多么重要想想看,每天你使用的各种不同的网络应用和移动应用...

这份AI通讯是你需要的一切 #75

本周OpenAI的戏剧性事件尘埃落定,Sam Altman和Greg Brockman重返OpenAI,并向董事会增任两位新任董事(与一位现任董事共同

在数据管理中实施数据湖

数据湖为多样化数据提供可扩展、灵活的存储,对于现代管理至关重要,但需要强大的治理能力

LMQL – 用于语言模型的SQL

我相信你肯定听说过SQL,甚至已经精通了它SQL(Structured Query Language)是一种被广泛应用于处理数据库数据的声明性语言根...

从 CSV 到使用 ChatGPT 创建完整分析报告的五个简单步骤

数据分析是一项耗时的活动借助ChatGPT,我们可以在很短的时间内进行数据摘要、数据预处理、数据可视化等等

回归基础第四周:高级主题和部署

欢迎回到 VoAGI 的“回归基础”系列的第四周本周,我们将深入探讨更高级的主题,如神经网络和部署

揭示隐藏的真相:揭开阿尔伯塔省人口贩卖的真相

我有幸在Data for Good作为志愿者与Policywise合作,参与了由Not In My City赞助的旨在打击亚伯达省人口贩卖的倡议我们共同的...

伪先知:将回归模型与Meta的先知进行比较

使用交叉验证来构建可视化和强大的指标,将自定义时间序列回归模型与Meta的预测工具Prophet进行比较

在几秒钟内使用ChatGPT生成令人惊叹的数据可视化

数据科学家们都喜欢它!看看ChatGPT如何仅凭几句话就创建令人瞠目结舌的数据可视化,简直太容易了,几乎不公平!

用Python在现实世界数据中检测幂律

在这里,我将介绍如何使用基于最大似然的方法从实证数据中检测幂律示例Python代码已包含在内

推荐系统中的两塔网络和负采样

目前在推荐系统中最重要的模型之一是双塔神经网络它们的结构如下:神经网络的一部分(塔)处理全部...

现实世界中的问题,以及数据如何帮助我们解决它们

随着对新工具和尖端模型的持续热议,很容易忽视一个基本事实:利用数据的真正价值在于它能够带来实际的积极影响......

使决策树产生更好结果的一步

通过训练了决策树模型,出现了自然过拟合超参数进行调优(不够满意)最终,决策树被随机森林取代虽然这可能对性能来说是快速...

‘MusicGen再创新:Meta在AI音乐方面的潜在进展’

在2023年2月,谷歌推出了他们的生成音乐AI MusicLM,引起了轰动那时候,有两件事变得清晰明了:许多人预期下一款突破性的模型...

PostgreSQL和OpenAI嵌入式的语义搜索

在企业数据库中实施语义搜索可能是具有挑战性且需要大量努力的但是,我们必须这样吗?在本文中,我将展示如何利用...

我的生活统计:我追踪了一年的习惯,这是我学到的东西

这可能是我一生中最长、最耗时的实验除此之外,它在科学意义上几乎没有什么价值——样本人群只有一个人——而且极为...

解开复杂性:噪声注入的流形学习的新方法

在数据科学领域,高维数据既是一个挑战,也是一个机会虽然它提供了许多关系和模式,可以被塑造和转化...

NLP(从零开始的doc2vec)和聚类:基于文本内容对新闻报道进行分类

有许多方法可以对这种类型进行分类,比如使用监督方法(标记数据集),使用聚类和使用特定的LDA算法(主题建模)我使用Doc2Ve...

自然语言处理(NLP)、神经网络(NN)、时间序列:能否使用谷歌趋势数据预测油价?

首先使用Word2Vec,然后从Google Trends中爬取Google搜索的频率,接下来使用时间序列(通过傅里叶分解)和Keras的神经网络,...

“全球最小的数据管道框架”

数据整理可能是数据科学家最耗时间的工作数据整理包括清洗、转换和一般操作数据,将其从原始状态转变为…