The Agent Testing Pyramid
We’ve been testing this out with our clients to fix agent quality, and the concept seems to be getting more and more solid:
1. Unit Tests (Base)
because if you pipeline is broken, it doesn't really matter how good your prompts or evals are
2. Evaluations, Optimization, Fine Tunning (Middle)
this is where your non-deterministic layer enters, an improvement here greatly compounds to the overall performance of the agent
3. Simulations (Top)
like end-to-end testing for agents, they test what really matters at the end of the day: can the agent actually solve real problems?
a combination of those is finally what lets us sleep well knowing our agents are working fully
2023年6月9日的北京智源大会上开幕式上,机器学习三巨头之一杨立昆(Yann Lecun)进行了远程致辞,发表了名为《朝向能学习, 思考和计划的机器进发》( Towards Machines that can Learn, Reason, and Plan)的演讲。
他在讲座中提出了对当前人工智能,特别是对自回归模型的批评。他认为,虽然这些模型在语言生成等任务上表现出色,但它们的核心问题在于没有规划和推理能力。杨立昆批评称,这些模型只是基于概率进行预测,对于大量的输入文本,它们的错误可能会成指数级增加。
此外,他对目前流行的AutoGPT,LOT等看似能够拆解任务,分步解释复杂问题的语言扩展模型进行了评价,他认为这些只是利用搜索和其他工具��人一种假象,即这些模型仿佛具有规划和推理能力,但实际上并非如此。
然后,Yann Lecun提出了他认为人工智能下一步的方向:世界模型。这种模型不仅在神经层面模仿人脑,而且在认知模块上也与人脑的工作方式一致。它能进行规划和预测,并结合成本核算模块,以最节约行动成本的逻辑进行规划。
朱军教授提出了符号学派和深度学习结合的可能性,Lecun则认为,由于符号逻辑不可微,两个系统无法兼容。
在总结自我监督学习的部分,Lecun表示自我监督学习已经在机器学习领域占据了主导地位,特别是在自然语言处理、文本理解和生成等领域。然而,他强调这些系统在某些地方还是有短板,例如它们无法像人类和动物那样进行深度推理和规划。
最后,他讨论了大型自回归语言模型,如Meta的FAIR、BlenderBot、Galactica、开源的Lama,以及DeepMind的Chinchilla和OpenAI的ChatGPT等,并表示他们在大量数据上表现出惊人的性能。