问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年6月26日,富士通正式发布创新PHOTON自上而下网络并行分层计算架构,针对当前AI领域主流Transformer大模型在长文本处理、高并发多查询场景下频繁访存导致的效率痛点,实现算力性能提升475倍,为破解全行业长期面临的算力成本高企、处理效率不足的共性难题提供了全新技术路径。
过去三年大语言模型的迭代速度远超行业预期,上下文窗口从4K快速跃升至百万Token级别,参数规模最高突破十万亿级,但支撑所有主流大模型的Transformer架构却已经显露出明显的先天短板。根据行业调研数据,在处理长文本推理、高并发多轮查询任务时,传统Transformer架构需要反复调取显存中的历史词元数据,访存延迟占总推理耗时的比例超过70%,GPU满负载运行时的有效计算占比不足30%,大量算力被白白消耗。仅2025年,全球企业用于大模型推理的算力投入同比上涨320%,高昂的成本已经成为AI技术落地的核心阻碍之一。
富士通此次推出的PHOTON架构,核心是跳出了传统Transformer的词元级计算逻辑,从架构层面做了自上而下的重构。
不同于传统Transformer对输入内容做逐词切割的处理方式,PHOTON首次引入了语义分层技术,会先将输入文本按照语义关联性划分为不同层级的计算块,推理过程中仅需要调用对应语义层的历史数据,无需全量遍历所有历史Token,直接将访存请求量降低了92%。
同时,分层结构也大幅提升了并行计算效率:不同语义层的计算任务可以在GPU上同时运行,有效计算占比从传统架构的不到30%提升至85%以上。针对高并发多查询场景,PHOTON还搭载了智能决策策略,通过“多数决定”“最佳选择”两种模式,让同一语义域下的多个查询可以共享中间计算结果,避免重复计算消耗资源。
根据富士通公布的测试数据,在128并发、100万Token长上下文的典型商用场景下,PHOTON架构的推理性能较同硬件配置的传统Transformer架构提升475倍,单位推理成本仅为原来的1/50。
富士通研发团队透露,预计2026年第四季度会将PHOTON架构的核心代码开源给全球AI开发者社区,方便开发者基于该架构优化现有大模型的推理效率。同时富士通也在和全球头部公有云厂商对接,计划2027年第一季度推出基于PHOTON架构的大模型推理云实例,首先落地金融长文档审核、政务多轮咨询、通用大模型推理优化等高频场景。
在业内看来,PHOTON架构的出现打破了过去行业“算力不足靠堆GPU”的固化思路,从计算架构层面的创新为破解全球AI算力瓶颈提供了新的可能,未来有可能带动一波大模型底层架构的创新浪潮。