Blog · corpus.blog/blogs/hugocisneros.com/posts
hugocisneros.com
hugocisneros.com
2026
26 Apr 2026
Notes on: Self-Distillation Enables Continual Learning by Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal (2026)original ↗
26 Apr 2026
26 Apr 2026
26 Apr 2026
Notes on: Reinforcement Learning via Self-Distillation by Hübotter, J., Lübeck, F., Behric, L., Baumann, A., Bagatella, M., Marta, D., Hakimi, I., Shenfeld, I., Kleine Buening, T., Guestrin, C. & Krause, A. (2026)original ↗
26 Apr 2026
Notes on: Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding by Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna (2026)original ↗
26 Apr 2026
26 Apr 2026
Notes on: DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning by Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu (2025)original ↗
26 Apr 2026
Notes on: GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery by Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du (2026)original ↗
26 Apr 2026
Notes on: LoRA Learns Less and Forgets Less by Dan Biderman, Jacob Portes, Jose Javier Gonzalez Ortiz, Mansheej Paul, Philip Greengard, Connor Jennings, Daniel King, Sam Havens, Vitaliy Chiley, Jonathan Frankle, Cody Blakeney, John P. Cunningham (2024)original ↗
26 Apr 2026
26 Apr 2026
Notes on: Residual Matrix Transformers: Scaling the Size of the Residual Stream by Brian Mak, Jeffrey Flanigan (2025)original ↗
26 Apr 2026
25 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
Notes on: Meta-Harness: End-to-End Optimization of Model Harnesses by Lee, Y., Nair, R., Zhang, Q., Lee, K., Khattab, O., & Finn, C. (2026)original ↗
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
19 Apr 2026
Notes on: Perception Encoder: The best visual embeddings are not at the output of the network by Daniel Bolya, Po-Yao Huang, Peize Sun, Jang Hyun Cho, Andrea Madotto, Chen Wei, Tengyu Ma, Jiale Zhi, Jathushan Rajasegaran, Hanoona Rasheed, Junke Wang, Marco Monteiro, Hu Xu, Shiyu Dong, Nikhila Ravi, Daniel Li, Piotr Dollár, Christoph Feichtenhofer (2025)original ↗
19 Apr 2026
Notes on: V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning by Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, Adrien Bardes (2026)original ↗
19 Apr 2026
Notes on: End-to-End Object Detection with Transformers by Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, Sergey Zagoruyko (2020)original ↗
19 Apr 2026
Notes on: SAM 3: Segment Anything with Concepts by Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang, Jie Lei, Tengyu Ma, Baishan Guo, Arpit Kalla, Markus Marks, Joseph Greer, Meng Wang, Peize Sun, Roman Rädle, Triantafyllos Afouras, Effrosyni Mavroudi, Katherine Xu, Tsung-Han Wu, Yu Zhou, Liliane Momeni, Rishi Hazra, Shuangrui Ding, Sagar Vaze, Francois Porcher, Feng Li, Siyuan Li, Aishworiginal ↗
19 Apr 2026
12 Apr 2026
12 Apr 2026
Notes on: DFlash: Block Diffusion for Flash Speculative Decoding by Jian Chen, Yesheng Liang, Zhijian Liu (2026)original ↗
12 Apr 2026
12 Apr 2026
12 Apr 2026
9 Apr 2026
9 Apr 2026
9 Apr 2026
9 Apr 2026
9 Apr 2026
Notes on: MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention by MiniMax (2025)original ↗
9 Apr 2026
Notes on: Attention Residuals by Kimi Team, Guangyu Chen, Yu Zhang, Jianlin Su et al. (2026)original ↗
8 Apr 2026
8 Apr 2026
Notes on: Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention by Katharopoulos, A., Vyas, A., Pappas, N., & Fleuret, F. (2020)original ↗
8 Apr 2026
8 Apr 2026
Notes on: Embarrassingly Simple Self-Distillation Improves Code Generation by Zhang, R., Bai, R. H., Zheng, H., Jaitly, N., Collobert, R., & Zhang, Y. (2026)original ↗
8 Apr 2026
8 Apr 2026
8 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
7 Apr 2026
Notes on: CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery by Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu Hong, Kaichen Zhou, Chonghe Jiang, Minwei Kong, Jiacheng Zhu, Xuan Jiang, Sirui Li, Cathy Wu, Bryan Kian Hsiang Low, Jinhua Zhao, Paul Pu Liang (2026)original ↗
7 Apr 2026
7 Apr 2026
7 Apr 2026
Notes on: Training Language Models via Neural Cellular Automata by Dan Lee, Seungwook Han, Akarsh Kumar, Pulkit Agrawal (2026)original ↗
7 Apr 2026
Notes on: Gecko: Versatile Text Embeddings Distilled from Large Language Models by Jinhyuk Lee, et al. (2024)original ↗
7 Apr 2026
7 Apr 2026
5 Apr 2026
5 Apr 2026
5 Apr 2026
Notes on: Large Language Models as Optimizers by Yang, C., Wang, X., Lu, Y., Liu, H., Le, Q. V., Zhou, D., & Chen, X. (2023)original ↗
5 Apr 2026
4 Apr 2026
2 Jan 2026
2025
30 Sept 2025
31 Jul 2025
31 May 2025
31 Mar 2025
2024
29 Oct 2024
2023
10 May 2023
1 May 2023
10 Apr 2023
8 Mar 2023
26 Feb 2023
23 Feb 2023
22 Feb 2023
22 Feb 2023
22 Feb 2023
22 Feb 2023
21 Feb 2023
21 Feb 2023
21 Feb 2023
21 Feb 2023
21 Feb 2023
21 Feb 2023
13 Feb 2023