OpenAI首席科学家雅库布·帕乔基昨日在X平台发布推文,回应AI模型推理不透明的争议。他指出,包括Astra在内的前沿模型计算图深度与GPT-4相差不到两倍,架构复杂度并未出现跳跃式增长。
这场争议源于The Information的深度报道,透露OpenAI正在测试“深度循环”技术。该技术让模型重复调用网络层持续更新内部表征,可能让思维链推理过程更难被追踪。相比传统线性结构,这种方式让模型决策路径更难通过自然语言解释。
主流大模型如ChatGPT、Claude和Gemini均基于Transformer架构,通常按线性步骤处理信息。但“深度循环”会让模型的实际推理更多隐藏在难以直接阅读的内部状态中。这种技术路线可能降低外部监控工具对模型决策路径的可解释性。
帕乔基强调,OpenAI自最初推出推理模型就重视思维链监控,但当前技术仍脆弱且面临架构变更带来的挑战。他透露加强监控是当前研究核心目标,同时解释计算图深度是衡量模型复杂度的核心指标。不过他未透露具体技术细节。
技术透明与模型复杂度的平衡仍是AI发展关键。