这个AI通讯简报就是你所需的全部 #76
时尚美容专家揭秘:你不可错过的AI通讯简报 #76
本周AI发生了什么
这个星期,我们关注了超越变压器和大型语言模型(LLM)的重要AI进展。尽管新的视频生成扩散模型不断发布,但最令我们兴奋的是DeepMind最新的材料模型GNoME。
GNoME是一个新型的大规模图神经网络,旨在发现新的晶体材料结构,大大提高了发现速度和效率。该模型的结果在本周被Deepmind宣布并提供。令人难以置信的是,这让人类已知的可能稳定材料数量每周增加了约10倍!GNoME对220万种材料的发现相当于大约800年的知识。在其220万个预测中,有380,000个被估计为稳定,成为实验合成的有希望的候选材料。尽管人类知识在这方面取得了巨大突破,但制造这些材料并测试其有用性的实验室和专家数量仍存在瓶颈。对此持积极态度的是,发布了第二篇论文,展示了如何利用人工智能来帮助生产这些材料。
为什么你应该关心

人类历史经常以新材料的发现和应用作为分段和描述,即使在今天,许多新技术也可以通过新材料的发现推动,从清洁能源到电脑芯片,核聚变能源,甚至室温超导体。我们认为Deepmind的新数据发布中可能含有改变游戏规则的新材料的机会很大;然而,要发现哪些新材料具有有用的性质以及能够以成本效益的方式大规模生产,仍需要很长时间。更广泛而言,图神经网络的扩大应用的成功表明,最近AI GPU的建设将带来超越大规模语言模型的突破。
– Louie Peters – Towards AI联合创始人兼首席执行官
最热新闻
Meta推出了一系列能够进行端到端表达和多语言翻译的模型,SeamlessM4T v2。Seamless是一个革命性的自动语音翻译系统。该先进模型可以在76种语言之间进行翻译,并保留说话者独特的声音风格和韵律,使对话更自然。
Stability AI推出SDXL Turbo,一种新的文本到图像模型,利用散射扩散蒸馏(ADD)在短时间内快速生成高质量图像。它能够快速而准确地在200多毫秒内创建512 x 512的图像。
Pika Labs发布了Pika 1.0,一款令人印象深刻的AI视频生成工具。它具有文本到视频和图像到视频转换等高级功能。该公司还获得了5500万美元的融资,以与巨头Meta、Adobe和Stability AI竞争。
4. Starling-7B:通过RLAIF提高LLM的有用性和无害性
伯克利发布了 Starling-7B,这是一款利用 AI 反馈强化学习(RLAIF)的强大语言模型。它利用了伯克利最新的 GPT-4 标注排序数据集 Nectar 的强大能力。该模型在除 OpenAI 的 GPT-4 和 GPT-4 Turbo 外的所有 MT-Bench 模型中表现优异。
AWS 推出了其下一代 AI 芯片 —— Graviton4 和 Trainium 2,用于模型训练和推理。Trainium 2 的性能提升了 4 倍,能效提升了 2 倍,而 Graviton4 的计算性能提升了 30%,核心数增加了 50%,内存带宽增加了 75%,相较于上一代芯片有了显著提升。
本周发布了几款新的生成模型,用于图像、音频和视频生成。你认为哪一款最有潜力?为什么?在评论中分享一下吧。
五个 5 分钟的阅读/视频,帮助你不断学习
该文章展示了著名的 Transformer 架构,包括 nano GPT、GPT2 和 GPT3 的可视化和交互式表示。文章清晰地展示了所有模块之间的连接。
这个视频指导开发者和 AI 爱好者如何改进 LLM,提供了对于小幅和重大改进的方法。视频还帮助选择从头开始训练、微调、(高级)提示工程和使用 Activeloop 的 Deep Memory 进行检索增强生成(RAG)。
自 OpenAI 默默推出 ChatGPT 以来已经过去了一年。本文追溯了过去一年 AI 进化的时间线,以及这些技术如何可能颠覆我们所知的创造性和知识工作。
AI 封装工具是利用 AI API 生成输出的实用工具,对于创作者来说经济效益显著。像 Formula Bot 和 PhotoAI 这样的例子年收入介于 20 万美元到 90 万美元之间。
Freshworks 的首席信息官 Prasad Ramakrishnan 强调了初创企业利用 AI 解决问题的几种实用案例。本文探讨了组织利用 AI 实现有效问题解决的五种方式,从提高用户体验到简化入职流程和优化数据平台。
知识库与工具
- Whisper Zero by Gladia 是 Whisper ASR 的全新改版,可以消除幻觉。
- Taipy 是一个用于构建网络应用前端和后端的开源 Python 库。
- GPT-fast 是一个简单高效的基于 PyTorch 的 Transformer 文本生成工具,源码行数不超过 1000 行。
- GitBook 是一个将团队知识库集中管理的技术知识管理平台。
本周顶级论文
GPT-4在使用新的Medprompt方法回答医疗问题方面已经超过了Med-PaLM 2。通过利用三种先进的提示策略,GPT-4在MedQA数据集上实现了惊人的90.2%的准确率。
“梅林”是一种新的由FPT和FIT支持的MLLM,它展示了增强的视觉理解、未来推理和多图像输入分析。研究人员提出将未来建模加入到多模式LLM中,以提高它们对基本原理和主体意图的理解。他们利用现有学习范式启发的Foresight Pre-Training (FPT)和Foresight Instruction-Tuning (FIT)技术。
海豚是一种设计为对话驾驶助手的视觉语言模型。它通过使用视频数据、文本指令和历史控制信号进行训练,全面理解自动驾驶车辆中的复杂驾驶场景。
本文介绍了扩散状态空间模型(DiffuSSM),这是一种用更可扩展的状态空间模型骨干取代注意机制的架构。这种方法有效地处理更高分辨率的图像,没有全局压缩,因此在扩散过程中保持了详细的图像表示。
这是一项对基于LLM的智能体的全面调查。它追溯了智能体的概念从哲学起源到在人工智能中的发展,并解释了为什么LLM是智能体的合适基础。它还提出了一个包括大脑、感知和行动三个主要组成部分的LLM智能体的通用框架。
快速链接
- 阿里巴巴云推出拥有720亿参数的同义千问人工智能语言模型。Qwen-72B与OpenAI的ChatGPT相竞争,在英语、中文、数学和编程方面表现出色。
- Nvidia首席执行官Jensen Huang领导公司的人工智能增长,使市值增加了2000亿美元。Nvidia在人工智能及其在各个行业中的应用上超过了沃尔玛等大公司。
- Google正在对生成式人工智能工具和法律纠纷的压力作出回应,对其搜索体验进行了改进。他们正在测试一项名为“笔记”的功能,用于公开评论搜索结果,并引入“关注”选项,允许用户订阅特定的搜索主题。
人工智能招聘
RYTE Corporation高级LLM工程师(法国巴黎,自由职业者)
TLA-LLC应用开发人员-专家-K0714(美国弗吉尼亚州)
有兴趣在这里分享一份工作机会吗?联系[email protected]。
如果您正在准备下一次机器学习面试,不要犹豫,查看我们领先的面试准备网站:confetti!

想让朋友也享受这个?分享该通讯让他们加入对话。




