Learn more about Data Science - Section 3

文字数据的创意,有时混乱的世界

几年来,文字和数据的交集(或多或少)都停留在自然语言处理(NLP)的范畴内——这是广泛使用文本数据进行机器学习任务的一系列...

使用Pandas进行的7个必要的数据质量检查

学习如何使用pandas进行数据质量检查从检测缺失记录到异常值、不一致的数据录入等等

回到基础 第二周:数据库,SQL,数据管理和统计概念

欢迎回到 VoAGI 的“回归基础”系列的第二周本周,我们将深入探讨数据库、SQL、数据管理和数据科学中的统计概念这个至关重要的领域

5个免费课程,掌握数据科学技能

想要进军数据科学领域吗?从今天开始通过这些免费课程来提升你的技能,学习编程、数据分析和机器学习

AI能否克服人类的确认偏见?

从诺贝尔奖得主丹尼尔·卡尼曼的《思考,快与慢》一书中,我们都知道人类的大脑在它们应该做的事情上远非完美除了情绪冲动之外...

《机器学习高质量数据集建立初学者指南》

在本教程中,我们将展示如何实现高质量的数据,并提高我们的机器学习分类结果

《顶级7个必备备考表,让你在数据科学面试中出类拔萃》

博客涵盖了关于SQL、统计学、pandas、数据可视化、scikit-learn、Git和理论数据科学概念的小抄

功能数据中的离群点检测密度核深度

密度核深度(DKD)方法提供了一种细致的方式来检测功能数据中的异常值,为复杂数据集提供清晰度,确保数据质量随着我们在日益...

软件测试中的机器学习

软件测试中的机器学习是指使用先进算法和数据驱动方法来自动化和提升测试流程

“用一个真实生活的例子和Python代码解释隐马尔可夫模型”

隐马尔可夫模型是一种概率模型,用于解决从天气预报到找出句子中下一个词的现实问题

理解SCD-慢变维度

在动态的数据管理领域中,慢变维度(Slowly Changing Dimensions,简称SCD)的概念成为一个关键的范式SCD是数据仓库领域的基...

吃过你的零食了吗?是时候展示数据科学的诀窍了

我们在TDS这里非常喜欢详尽的指南,但我们也很欣赏针对数据科学家在日常工作中面临的具体挑战和痛点的专注帖子要…

学术界在方法论上过于迷恋,而忽视了真实的洞见吗?

一篇关于千禧年学者对方法论高于洞察力的观点的文章

用时间序列分析提升回归模型的稳健性 — 第一部分

从家里只有1.5小时车程的地方,新加坡总是吸引着我被庞大的邻国环绕,这个小国度克服了很多困难从独立时谦逊的开端,到如今……

《分布式数据并行(DDP)的综合指南》

大家好!我是Francois,Meta的研究科学家欢迎来到系列教程中的新教程部分,令人惊叹的AI教程在这个教程中,我们将揭秘一种广...

《变形金刚百科全书:你需要了解的一切》

你可能已经听说过变形金刚,并且大家都在谈论它,那为什么还要写一篇新的文章呢?嗯,我是一名研究者,这就要求我对...有非常...

从破布到富有 (Cóng pòbù dào fùyǒu)

随着大型语言模型(LLMs)的崛起,向量搜索引擎也随之出现向量数据库构成了LLMs的长期记忆系统的基础通过...

南瓜香料时间序列分析 (Nánguā xiāngliào shíjiān xùliè fēnxī)

北半球的季节又到了——这是一个关于苹果、南瓜和各种调配了肉桂、肉豆蔻、姜、多香果和丁香的时刻而当零售店的过道开始...

PyrOSM:使用Open Street Map数据

如果你以前有过处理OSM数据的经验,你就知道它并不是最容易提取的OSM数据可能非常庞大,找到适合你要分析的性能解决方案通常...

机器学习工程师必备的工具

大约4年前,我将我的职业从SAP顾问转变为数据科学家在按照我自己设计的课程进行学习后,我成功地获得了一份机器学习工程师职...