AI资讯新闻榜单内容搜索-Pixel

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Pixel
无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

过去几年,扩散模型几乎定义了高质量图像生成:从随机噪声出发,经过多轮迭代,逐步 “雕刻” 出一张图像。但随着大语言模型席卷人工智能领域,另一条路线正迅速走到舞台中央 —— 图像,能否也像语言一样,通过自回归方式逐步生成?

来自主题: AI技术研报
7263 点击    2026-07-14 11:07
谷歌AI不认识Google

谷歌AI不认识Google

谷歌AI不认识Google

今天,又有新的问题出现了,这一次是谷歌搜索。有用户发现,近日升级了 AI 能力的谷歌搜索在面对「google 里面有几个 P」这样的简单问题时竟然失败了!这件事引发广泛关注和测试热潮。我们也简单试了下,就算用汉语提问,谷歌搜索同样错误,而且还自行加戏,导致错上加错 —— 说 Pixel 里面有两个 P

来自主题: AI资讯
9562 点击    2026-05-28 20:57
像素绽放PixelBloom 完成C轮融资,全面发力AI办公解决方案Agent:从“一分钟生成PPT”到“交付商用级结果”

像素绽放PixelBloom 完成C轮融资,全面发力AI办公解决方案Agent:从“一分钟生成PPT”到“交付商用级结果”

像素绽放PixelBloom 完成C轮融资,全面发力AI办公解决方案Agent:从“一分钟生成PPT”到“交付商用级结果”

今日,像素绽放PixelBloom宣布完成C轮融资。本轮融资由国科投资与商汤国香资本联合领投,基石创投、大米创投跟投。 资金将重点投入AI办公解决方案Agent的研发迭代、商业化落地及全球化人才招募。

来自主题: AI资讯
9682 点击    2026-05-09 10:35
开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布

开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布

开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布

来自 Player2 的研究员们提出了 Pixel2Play(P2P)模型,该模型以游戏画面和文本指令作为输入,直接输出对应的键盘与鼠标操作信号。在消费级显卡 RTX 5090 上,P2P 可以实现超过 20Hz 的端到端推理速度,从而能够真正像人类一样和游戏进行实时交互。P2P 作为通用游戏基座模型,在超过 40 款游戏、总计 8300 + 小时的游戏数据上进行了训练,

来自主题: AI技术研报
8904 点击    2026-01-18 15:01
发现一个贼牛的开源项目,AI一键生成完整视频

发现一个贼牛的开源项目,AI一键生成完整视频

发现一个贼牛的开源项目,AI一键生成完整视频

从ChatGPT爆火以后,就总有“AI太牛了,自己是不是要失业了”等等类似的声音出现。

来自主题: AI技术研报
11298 点击    2026-01-14 11:46
PixelRefer :让AI从“看大图”走向“看懂每个对象”

PixelRefer :让AI从“看大图”走向“看懂每个对象”

PixelRefer :让AI从“看大图”走向“看懂每个对象”

多模态大模型(MLLMs)虽然在图像理解、视频分析上表现出色,但多停留在整体场景级理解。

来自主题: AI技术研报
11791 点击    2025-11-11 09:50
大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态大模型(MLLM)在自然图像上已取得显著进展,但当问题落在图表、几何草图、科研绘图等结构化图像上时,细小的感知误差会迅速放大为推理偏差。

来自主题: AI技术研报
8192 点击    2025-11-03 14:20