Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

2 Commits
 
 
 
 

Repository files navigation

PixelPX

pixel professional generative X —— 从光变化中涌现 3D 结构的图片生成模型


这是什么?

一句话:我们不搞 Text-to-Image,我们搞 Image-to-Image。

T2I 的毛病在于,每张训练图都得靠"文本描述"才能被模型理解。描述本身就是瓶颈——你描述得再精确,也是用语言去干几何该干的活。就像让音乐去描述颜色,跨域映射,必然失真。

PixelPX 的思路是:图片是静态的视频,视频里有 3D 和时间信息。用视频训练出 3D 理解,再"啪的一下"降维压缩成 2D 图。

没有物理引擎。现在的视频模型也不是物理引擎,它们只是二维模拟的 3D 和时间数据。我们不可能设计出物理引擎。3D 一致性是靠几何约束从数据里学出来的,不是算出来的。


起源故事

本来是喷李飞飞 World Labs 所谓"世界模型"的口水,喷着喷着突然发现——我要做的生图模型,竟然就是她们在做的世界模型。大水冲了龙王庙,小丑竟是我自己。

但凭我们的脾气,也是不能认的。李飞飞的路子要天量算力,我们偏不信这个邪。从昨晚干到今晚,搞出来了一个 1.1M 参数的验证版,30 张凭空生成的图片,跑通了从训练到生成的全流程。

详细的故事和我当时的思考过程,写在公众号里了:

喷着口水搞出来的 PixelPX —— 一个低算力世界模型的诞生


技术白皮书

面向公众的技术方向公开文档,包含完整的算法理念、架构设计和预训练成果:

PixelPX 技术白皮书 v1.0

白皮书里讲了:

  • T2I 的描述瓶颈为什么是打补丁而不是治本
  • 四条第一性原理(图片=静态视频、用视频训练、结构预测而非像素生成、无物理引擎)
  • 核心创新:从光变化中涌现 3D(自然力做物理,我们只学光场)
  • 技术体系:PXFormer、GeoTriangle、GXI、PXLoop 等自有架构
  • 生成管线:text2sample-image2FINALIMAGE 三段式
  • 预训练成果:Step 1-6 完整数据链

预训练成果

1.1M 参数的小模型,在一张 RTX 3050 Laptop(4GB 显存)上跑的,别嫌小——这是架构验证,不是产品。

Step 干了什么 关键指标 过没过
Step 1 合成数据最小验证 L1=0.040
Step 2 3D 原点场 + 几何不变性 Z 相关 0.9997
Step 3 真实牧场单场景 L1=0.035
Step 4 多场景灰度(5 场景) L1=0.058
Step 5 RGB 彩色(5 场景) L1=0.067,光场捕获色温
14 机位 SkyFinder 联合训练 L1=0.0313,插时刻比值 1.02
Step 6 BERT 式 Mask 补全 补全/重建比值 0.86
image-gen 凭空生成 30 张图 多样性 2.75

命门指标是插时刻 L1 ≈ 重建 L1——意思是模型不是死记像素,是真学到了 3D 结构和光场规律,能预测没见过的中间帧。14 机位训练的比值是 1.02,接近完美。


核心理念

视频 = 训练数据(学光影关系)
  ↓ 降维打击
图片 = 应用产品(补全/生成)

三种生成模式:

  • image-gen(凭空生成):啥也不给,直接抽卡
  • Completion(补全):给半张图,补成整张
  • Transformation(变换):给整张图 + 换个光场,出不同时刻的图

和别人的区别

维度 T2I 扩散 伪世界模型视频 3D 世界生成派 PixelPX
3D 表征 无显式 渲染基元 3D 原点场
物理引擎 伪物理(外挂损失) 无(几何先验学出来)
训练数据 图文对 海量视频 配对 (image, 3D) 单视频自监督
caption 瓶颈
数据成本 极高 极低

算力可以买,数据买不到。 3D 世界生成派的命门是 3D 数据稀缺。我们用单视频自监督,视频帧本身就是真值,数据无限,只愁算力。


历史验证

这不是空中楼阁——400 年的古典画家就是这么干的。

维米尔画《倒牛奶的女仆》,坐几小时,太阳从东窗移到西窗,阴影一直在变。他从"阴影怎么变"推断出"桌面是平的、罐子是圆的"。他就是从光变化学 3D,然后落笔画的是"理解了完整光场之后的一个时刻"。

画家做了 400 年,我们只是把画家的脑子换成 PXFormer + GXI。方法论同构,工具升级。


下一步

  • 扩规模到 100 场景,接入完整算子
  • PXscore 打分体系(每 patch 的 3D 置信度)
  • 完整 GXI 等变模块 + PXLoop 循环精化
  • image-gen 质量提升 + 扩散精化器接入

知识产权

具体算子实现、训练细节和架构参数属于商业机密,公开文档不予披露。

如有私有化模型训练和后训练需求,可聘请我们做训模工程队。


PixelPX:从光变化中涌现 3D 结构。

About

PixelPX — 从光变化中涌现 3D 结构的图片生成模型

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors