你好不吃虾文章 ↗
← 全部文章

AI × RESEARCH

这一类文章,
集中讨论什么。

01
AI × RESEARCH

6月前沿速递 | AI推理模型是假的?苹果证明DeepSeek-R1等大模型根本没有推理能力?

6月前沿速递 AI推理模型是假的?苹果证明DeepSeek-R1等大模型根本没有推理能力? 引言 近期,一系列被称为大型推理模型(Large Reasoning Models, LRM)的新模型被提出,其特点是在生成最终答案前会产生详细的思考过程。尽管这些模型在多个推理基准上展示了性能提升,但学术界对其基本能力、扩展规律及内在局限性的理解仍不充分。现有评估范式主要依赖固定的数学…

5 min ↗
02
AI × RESEARCH

AI开始‘反侦察’?看RAG如何通过主动检索破解模型‘幻觉’困局”

AI开始‘反侦察’?看RAG如何通过主动检索破解模型‘幻觉’困局” 引言: 博士生小张 (抓头):“导师,我的模型又‘幻觉’了!生成的病例分析全是虚构的药理数据……” 导师 (微笑):“试试RAG+Search-o1吧,它能像侦探一样主动检索知识库,还能自我修正推理链。” 小张 (瞪大眼):“啥?AI还能自己查资料、做验证?” 导师 (递咖啡):“最新的模块化RAG,已经进化到…

4 min ↗
03
AI × RESEARCH

【集合】大模型的自我评估

【集合】大模型的自我评估 目的 预训练之后的模型就是next token prediction(文本续写),预测需要微调才能够使其的回答符合人类的期望。 将生成和强化学习结合起来,强化学习通过奖励函数直接或间接地为模型提供有监督的判定标准。因此,在大模型中引入强化学习可以提升其判断能力。 - 最新大模型反思 - 用强化学习做 - 过程奖励 - 蒙特卡洛树 论文 RLHF 英文名…

8 min ↗
04
AI × RESEARCH

全球首款通用AI Agent「Manus」来了!中国团队打造,让AI真正替你干活!

全球首款通用AI Agent「Manus」来了!中国团队打造,让AI真正替你干活! 引言: 2025年3月6日凌晨,AI圈被一款名为「Manus」的产品彻底引爆!它不仅是全球首款真正意义上的通用型AI Agent,更以“中国造”的身份在GAIA基准测试中碾压OpenAI等巨头。这款由Monica.im团队研发的产品,凭借其“从规划到交付”的全链路自主能力,被誉为“AI Agen…

3 min ↗
05
AI × RESEARCH

大模型首次通过图灵测试 | 人类辨别失败率超70%!科学研究揭示人工智能发展新里程碑

大模型首次通过图灵测试 人类辨别失败率超70%!科学研究揭示人工智能发展新里程碑 3月31日,一项来自加州大学圣地亚哥分校的研究表明,最新一代的大型语言模型 LLM 首次成功通过了经典的三方图灵测试。这一研究结果标志着人工智能发展史上的重要里程碑,也引发了关于AI智能本质和社会影响的深入讨论。 摘要: 我们在两个针对独立人群的随机、对照和预先注册的图灵测试中评估了 4 个系统 …

5 min ↗
06
AI × RESEARCH

当GPT-4能同时读懂你的表情、语调和心跳数据

当GPT-4能同时读懂你的表情、语调和心跳数据 想象一下:你正在参加一个充满活力的鸡尾酒会🍹,充满了谈话的嗡嗡声和酒杯的碰撞声🍻 .你是一个悠闲的观察者👀,舒适地坐落在一个角落里。 然而,你仍然可以通过解读人们的语言和非语言暗示,轻松地找出不同人之间的社交关系,了解发生了什么,甚至提供社交建议。 如果大型语言模型(LLM)能够复制这种社交能力,那么我们就可以说它具备了一定的社交…

3 min ↗