谷歌突然发布“最强听写模型”:Agent时代的落伍产品,还是关键拼图?
谷歌突然发布“最强听写模型”:Agent时代的落伍产品,还是关键拼图?谷歌发布语音转文本模型Gemini 3.5 Transcribe,支持85种以上语言、流式转录与智能整理功能,流式词错误率为4.0%,文章认为该模型并非Agent时代的落伍产品,而是语音Agent走向生产环境所必需的关键基础拼图。
搜索
谷歌发布语音转文本模型Gemini 3.5 Transcribe,支持85种以上语言、流式转录与智能整理功能,流式词错误率为4.0%,文章认为该模型并非Agent时代的落伍产品,而是语音Agent走向生产环境所必需的关键基础拼图。
Sweekar 是由零动未来推出的口袋 AI 电子宠物,整机重量仅89克,小巧的蛋形机身便携性不错,很适合桌面摆放和日常携带。
过去一年,很多品牌都在研究 GEO。 简单说,就是以前想办法让自己出现在 Google 搜索第一页,现在要想办法让 ChatGPT、Gemini 这些 AI 在回答问题时提到自己。但最近几个月,事情已经又往前走了一步。
Gemini早期在Coding这事儿上,做得确实不太行哈。。。
Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。
距离 3.6 Flash 发布才过去 3 周,Google 又端上了 Gemini 3.7 Flash。刚刚接掌 Google DeepMind 的 Koray Kavukcuoglu 发文介绍,这是新一代面向 Coding 和 Agent 工作流的主力模型,首发价格只有 Gemini 3.6 Flash 原始价格的一半。
眼瞅着自家Gemini迟迟难产,技术问题短期解决不了,那就索性先解决物理问题——大!西!洋!时!差!什么研发、什么产品、什么商业化,都甭给我隔着八个时区远程协作了,核心负责人们直接来加州《坐班》哈~
斯坦福最近公开了一门课的录像,叫 CS329A,主题是 Self-Improving AI Agents(自我改进的 AI agent)。两位主讲教授,Aakanksha Chowdhery 和 Azalia Mirhoseini,都有极深的工业背景。Aakanksha 曾是 Google 540B 参数 PaLM 模型的技术负责人,也参与了 Gemini 的研发
谷歌:在LLM圈里我唯唯诺诺,在机器人圈里我直接大打出手!
过去两年,多模态模型的竞争看起来像一场“造眼睛”的竞赛:更高的图像分辨率、更多的视觉 token、更大的模型,以及更昂贵的训练。行业似乎默认,只要第一次看得足够清楚,AI 就能从“看见”抵达“洞见”。